<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Tts</title><link>https://www.communeify.com/tw/tag/tts/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/tag/tts/" rel="self" type="application/rss+xml"/><item><title>Sopro V2：120M 也能做到串流與零樣本聲音複製的開源 TTS</title><link>https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</guid><pubDate>Fri, 25 Sep 2026 08:20:00 +0800</pubDate><description> 在輕量級語音合成領域，兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數，也能在地端 CPU 上實現高可讀性與流暢串流。
什麼是 Sopro V2 Turbo？模型規模與語言支援 Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性：
模型規模：僅 120M 參數（1.2 億參數），由 0.5B 教師模型經過 DPO（直接偏好優化）與 Self-Distillation 自蒸餾，並結合 2-step Reflow 技術進行 16 倍加速優化。 授權條款：採用 Apache-2.0 自由開源授權。 多語言支援：原生支援 英語（English）、歐洲葡萄牙語（European Portuguese）、法語（French）與德語（German） 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語（而非巴西葡萄牙語）進行深度調校與對齊的開源語音模型。 零樣本聲音複製（Zero-Shot Voice Cloning）：僅需 5 至 20 秒的參考音訊，且無需提供參考音訊的文字逐字稿（ASR-free prompt），即可捕捉目標聲音的音色、麥克風環境與說話風格。 速度與本機 CPU / 裝置端適用性 Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成，擺脫對雲端 API 的依賴與高昂延遲。
推論效能數據（RTF 與首音延遲） 在官方特定測試環境下，推論表現如下：
Apple M3 CPU (MacBook 筆電)： 非串流模式（Offline）：實時率（RTF）為 0.24（生成速度約為即時播放的 4.1 倍）。 串流模式（Streaming）：RTF 為 0.21，首音時間（Time-to-first-audio, TTFA）僅約 300 毫秒。 NVIDIA H100 GPU： 非串流 RTF 為 0.07，串流模式首音時間約 200 毫秒。 本機與瀏覽器端部署 由於參數規模僅 120M，Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外，官方亦提供了基於 ONNX Runtime（WebGPU / WASM）的純瀏覽器前端實現，使用者無需設定後端伺服器，即可在網頁端直接進行地端語音推理。</description></item><item><title>TontaubeV1：把長篇語音生成搬回本機的 2.9B 開放權重 TTS 模型</title><link>https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</guid><pubDate>Fri, 25 Sep 2026 08:00:00 +0800</pubDate><description> 如果你想把一段文章直接念成十幾分鐘的旁白，TontaubeV1 的重點不是「聲音像不像真人」這一句宣傳，而是它試圖把長篇、串流與本機推理同時處理好。
先看結論：它解決的是長篇語音的工程問題 TontaubeV1 是 Tontaube AI（由 Fritz Cremer 與 Jonathan Cremer 開發）發布的 2.9B（約 28.7 億參數）開放權重文字轉語音模型，定位在富有表達力的長篇語音、低延遲回傳與本機部署。模型主要針對英語和德語進行調校，並支援西班牙語、法語、義大利語、荷蘭語與葡萄牙語等共 7 種語言，同時能使用 5 至 60 秒（上限約 1 分鐘）的參考音檔進行零樣本聲音複製（Zero-Shot Voice Cloning）。
這個定位和只產生一句廣告口號的 TTS 不太一樣。長篇內容會遇到更多實際問題：段落之間的語氣是否連得起來、生成時能不能一邊播放一邊繼續合成、文字很長時上下文會不會失控，以及一次處理多個請求時 GPU 是否浪費在等待上。TontaubeV1 的設計幾乎都圍繞這些問題展開。
在授權方面需特別注意：推理服務程式碼採用 Apache License 2.0 開源授權，但模型權重本身採用的是 Tontaube Community Model License 1.0，屬於允許研究與符合條件之商業用途的開放權重（Open-weight）授權，而非純粹的 OSI 開源授權。
架構重點：四個自回歸模型接力產生聲音 官方技術報告把 TontaubeV1 描述成由四個自回歸模型（CB0 至 CB3）組成的分層語音生成系統。它採用 DualCodec（12.5 Hz，總位元率約 625 bit/s）作為語音表徵，將語音拆解為 1 個語意碼本與 3 個聲學精鍊碼本：
CB0（語意與時長預測）：基於 Qwen3-1.7B 骨幹（約 18.3 億參數，28 個 Transformer 區塊），負責從文字生成語意音訊碼本並決定語音時長與韻律。 CB1（聲學精鍊一）：基於 Qwen3-0.6B 骨幹（約 4.49 億參數，16 個 Transformer 區塊），補上第一層聲學細節。 CB2（聲學精鍊二）：基於 Qwen3-0.6B 骨幹（約 3.27 億參數，8 個 Transformer 區塊），進一步擴充聲學殘差。 CB3（聲學精鍊三）：基於 Qwen3-0.6B 骨幹（約 2.69 億參數，4 個 Transformer 區塊），完成最後一層聲學修飾。 四個模型總計 56 個 Transformer 區塊、約 28.7 億參數。這種設計有兩個直接好處：</description></item></channel></rss>