NEW-MODEL FIELD NOTE

Sopro V2:120M 也能做到串流與零樣本聲音複製的開源 TTS

在輕量級語音合成領域,兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數,也能在地端 CPU 上實現高可讀性與流暢串流。 什麼是 Sopro V2 Turbo?模型規模與語言支援 Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性: 模型規模:僅 120M 參數(1.2 億參數),由 0.5B …

PUBLISHED 2026.09.25
READING TIME 2 MIN
UPDATED 2026.09.25
01

COMMUNEIFY
EDITORIAL

把複雜的技術,整理成值得慢慢讀完的內容。

在輕量級語音合成領域,兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數,也能在地端 CPU 上實現高可讀性與流暢串流。

什麼是 Sopro V2 Turbo?模型規模與語言支援

Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性:

  • 模型規模:僅 120M 參數(1.2 億參數),由 0.5B 教師模型經過 DPO(直接偏好優化)與 Self-Distillation 自蒸餾,並結合 2-step Reflow 技術進行 16 倍加速優化。
  • 授權條款:採用 Apache-2.0 自由開源授權。
  • 多語言支援:原生支援 英語(English)、歐洲葡萄牙語(European Portuguese)、法語(French)與德語(German) 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語(而非巴西葡萄牙語)進行深度調校與對齊的開源語音模型。
  • 零樣本聲音複製(Zero-Shot Voice Cloning):僅需 5 至 20 秒的參考音訊,且無需提供參考音訊的文字逐字稿(ASR-free prompt),即可捕捉目標聲音的音色、麥克風環境與說話風格。

速度與本機 CPU / 裝置端適用性

Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成,擺脫對雲端 API 的依賴與高昂延遲。

推論效能數據(RTF 與首音延遲)

在官方特定測試環境下,推論表現如下:

  • Apple M3 CPU (MacBook 筆電):
    • 非串流模式(Offline):實時率(RTF)為 0.24(生成速度約為即時播放的 4.1 倍)。
    • 串流模式(Streaming):RTF 為 0.21,首音時間(Time-to-first-audio, TTFA)僅約 300 毫秒。
  • NVIDIA H100 GPU:
    • 非串流 RTF 為 0.07,串流模式首音時間約 200 毫秒。

本機與瀏覽器端部署

由於參數規模僅 120M,Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外,官方亦提供了基於 ONNX Runtime(WebGPU / WASM)的純瀏覽器前端實現,使用者無需設定後端伺服器,即可在網頁端直接進行地端語音推理。

官方評測數字:區分 WER 與說話者相似度

評測語音模型時,必須將字詞錯誤率(WER,代表可讀性與發音正確度)與說話者相似度(SIM,代表音色複製逼真度)、韻律(Prosody)及聲音自然度分開看待。官方採用 Whisper large-v3 計算 WER,並以 WavLM 聲紋模型計算 SIM:

1. Seed-TTS-eval (test-en) 英文評測

  • Sopro V2 Turbo (2-step):WER 為 1.63%,說話者相似度 SIM 為 0.655。
  • Sopro V2 Turbo (Streaming):WER 為 1.44%,SIM 為 0.649。
  • 與大型模型對比:Sopro V2 Turbo 的字詞錯誤率優於規模大 3 至 14 倍的模型,例如 F5-TTS (336M, WER 1.83%)、CosyVoice 3 (0.5B, WER 2.02%)、Spark-TTS (0.5B, WER 1.98%) 與 MaskGCT (1.0B, WER 2.62%)。

2. LibriSpeech test-clean (F5 協定)

  • Sopro V2 Turbo (2-step):WER 為 1.79%,SIM 為 0.654。
  • Sopro V2 Turbo (Streaming):WER 為 1.88%,SIM 為 0.646。
  • 對比基準:字詞錯誤率顯著低於 F5-TTS (WER 2.42%)、E2-TTS (WER 2.95%) 及 CosyVoice (WER 3.59%)。

3. MiniMax 多語言測試集 (MiniMax Multilingual Eval)

在四種支援語言的測試中,Sopro V2 Turbo 的表現分別為:

  • 英語 (en):WER 1.98 / SIM 0.715
  • 德語 (de):WER 0.62 / SIM 0.754
  • 法語 (fr):WER 4.60 / SIM 0.702
  • 葡萄牙語 (pt):WER 2.51 / SIM 0.699(註:由於評測集的葡萄牙語參考音為巴西發音,而 Sopro 著重於歐洲發音,受限於 ASR 對元音弱化的轉寫偏差,WER 數值略高)。

本地試用與啟動命令

您可以透過以下單一 CLI 命令啟動在地端執行的服務與 Web UI 介面:

uvx --from sopro soprotts serve

執行後,系統將自動下載模型權重並在 http://localhost:7860 開啟本地操作介面。若已安裝套件,亦可直接執行 soprotts serve。

安全規範與倫理邊界

由於開源的推論管道極易被惡意繞過或移除,官方並未在模型中強行加入數位水印。使用者在利用 Sopro V2 Turbo 進行聲音複製時,必須明確取得聲音持有者本人的授權與同意,且任何產出的產品或應用均應清楚標示該音訊為 AI 合成內容,嚴禁將其用於身分冒用、詐欺或未經授權的聲音複製行為。

相關連結

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.