<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Edge-Ai</title><link>https://www.communeify.com/tw/tag/edge-ai/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/tag/edge-ai/" rel="self" type="application/rss+xml"/><item><title>Sopro V2：120M 也能做到串流與零樣本聲音複製的開源 TTS</title><link>https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</guid><pubDate>Fri, 25 Sep 2026 08:20:00 +0800</pubDate><description> 在輕量級語音合成領域，兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數，也能在地端 CPU 上實現高可讀性與流暢串流。
什麼是 Sopro V2 Turbo？模型規模與語言支援 Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性：
模型規模：僅 120M 參數（1.2 億參數），由 0.5B 教師模型經過 DPO（直接偏好優化）與 Self-Distillation 自蒸餾，並結合 2-step Reflow 技術進行 16 倍加速優化。 授權條款：採用 Apache-2.0 自由開源授權。 多語言支援：原生支援 英語（English）、歐洲葡萄牙語（European Portuguese）、法語（French）與德語（German） 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語（而非巴西葡萄牙語）進行深度調校與對齊的開源語音模型。 零樣本聲音複製（Zero-Shot Voice Cloning）：僅需 5 至 20 秒的參考音訊，且無需提供參考音訊的文字逐字稿（ASR-free prompt），即可捕捉目標聲音的音色、麥克風環境與說話風格。 速度與本機 CPU / 裝置端適用性 Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成，擺脫對雲端 API 的依賴與高昂延遲。
推論效能數據（RTF 與首音延遲） 在官方特定測試環境下，推論表現如下：
Apple M3 CPU (MacBook 筆電)： 非串流模式（Offline）：實時率（RTF）為 0.24（生成速度約為即時播放的 4.1 倍）。 串流模式（Streaming）：RTF 為 0.21，首音時間（Time-to-first-audio, TTFA）僅約 300 毫秒。 NVIDIA H100 GPU： 非串流 RTF 為 0.07，串流模式首音時間約 200 毫秒。 本機與瀏覽器端部署 由於參數規模僅 120M，Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外，官方亦提供了基於 ONNX Runtime（WebGPU / WASM）的純瀏覽器前端實現，使用者無需設定後端伺服器，即可在網頁端直接進行地端語音推理。</description></item></channel></rss>