在輕量級語音合成領域,兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數,也能在地端 CPU 上實現高可讀性與流暢串流。
什麼是 Sopro V2 Turbo?模型規模與語言支援
Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性:
- 模型規模:僅 120M 參數(1.2 億參數),由 0.5B 教師模型經過 DPO(直接偏好優化)與 Self-Distillation 自蒸餾,並結合 2-step Reflow 技術進行 16 倍加速優化。
- 授權條款:採用 Apache-2.0 自由開源授權。
- 多語言支援:原生支援 英語(English)、歐洲葡萄牙語(European Portuguese)、法語(French)與德語(German) 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語(而非巴西葡萄牙語)進行深度調校與對齊的開源語音模型。
- 零樣本聲音複製(Zero-Shot Voice Cloning):僅需 5 至 20 秒的參考音訊,且無需提供參考音訊的文字逐字稿(ASR-free prompt),即可捕捉目標聲音的音色、麥克風環境與說話風格。
速度與本機 CPU / 裝置端適用性
Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成,擺脫對雲端 API 的依賴與高昂延遲。
推論效能數據(RTF 與首音延遲)
在官方特定測試環境下,推論表現如下:
- Apple M3 CPU (MacBook 筆電):
- 非串流模式(Offline):實時率(RTF)為 0.24(生成速度約為即時播放的 4.1 倍)。
- 串流模式(Streaming):RTF 為 0.21,首音時間(Time-to-first-audio, TTFA)僅約 300 毫秒。
- NVIDIA H100 GPU:
- 非串流 RTF 為 0.07,串流模式首音時間約 200 毫秒。
本機與瀏覽器端部署
由於參數規模僅 120M,Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外,官方亦提供了基於 ONNX Runtime(WebGPU / WASM)的純瀏覽器前端實現,使用者無需設定後端伺服器,即可在網頁端直接進行地端語音推理。
官方評測數字:區分 WER 與說話者相似度
評測語音模型時,必須將字詞錯誤率(WER,代表可讀性與發音正確度)與說話者相似度(SIM,代表音色複製逼真度)、韻律(Prosody)及聲音自然度分開看待。官方採用 Whisper large-v3 計算 WER,並以 WavLM 聲紋模型計算 SIM:
1. Seed-TTS-eval (test-en) 英文評測
- Sopro V2 Turbo (2-step):WER 為 1.63%,說話者相似度 SIM 為 0.655。
- Sopro V2 Turbo (Streaming):WER 為 1.44%,SIM 為 0.649。
- 與大型模型對比:Sopro V2 Turbo 的字詞錯誤率優於規模大 3 至 14 倍的模型,例如 F5-TTS (336M, WER 1.83%)、CosyVoice 3 (0.5B, WER 2.02%)、Spark-TTS (0.5B, WER 1.98%) 與 MaskGCT (1.0B, WER 2.62%)。
2. LibriSpeech test-clean (F5 協定)
- Sopro V2 Turbo (2-step):WER 為 1.79%,SIM 為 0.654。
- Sopro V2 Turbo (Streaming):WER 為 1.88%,SIM 為 0.646。
- 對比基準:字詞錯誤率顯著低於 F5-TTS (WER 2.42%)、E2-TTS (WER 2.95%) 及 CosyVoice (WER 3.59%)。
3. MiniMax 多語言測試集 (MiniMax Multilingual Eval)
在四種支援語言的測試中,Sopro V2 Turbo 的表現分別為:
- 英語 (en):WER 1.98 / SIM 0.715
- 德語 (de):WER 0.62 / SIM 0.754
- 法語 (fr):WER 4.60 / SIM 0.702
- 葡萄牙語 (pt):WER 2.51 / SIM 0.699(註:由於評測集的葡萄牙語參考音為巴西發音,而 Sopro 著重於歐洲發音,受限於 ASR 對元音弱化的轉寫偏差,WER 數值略高)。
本地試用與啟動命令
您可以透過以下單一 CLI 命令啟動在地端執行的服務與 Web UI 介面:
uvx --from sopro soprotts serve
執行後,系統將自動下載模型權重並在 http://localhost:7860 開啟本地操作介面。若已安裝套件,亦可直接執行 soprotts serve。
安全規範與倫理邊界
由於開源的推論管道極易被惡意繞過或移除,官方並未在模型中強行加入數位水印。使用者在利用 Sopro V2 Turbo 進行聲音複製時,必須明確取得聲音持有者本人的授權與同意,且任何產出的產品或應用均應清楚標示該音訊為 AI 合成內容,嚴禁將其用於身分冒用、詐欺或未經授權的聲音複製行為。

