Zyphra 推出 ZONOS2：首款 MoE 即時 TTS 語音克隆模型，支援中文與商用開源

，官方也在 GitHub 開源了配套

與答 (Q&A) Q1

tool

Zyphra 推出 ZONOS2：首款 MoE 即時 TTS 語音克隆模型，支援中文與商用開源

2025-06-15

Zyphra 推出 ZONOS2：首創 MoE 架構的即時 TTS 語音克隆模型

Zyphra 最新推出的 ZONOS2 是一款採用 Apache 2.0 授權的開源文字轉語音模型。首創導入混合專家架構，不僅達成低延遲語音生成，更具備極高逼真度的語音克隆能力，並支援中英日等多國語言。

大家或許都有過這樣的經驗。在人工智慧語音生成的圈子裡，要嘛跑得快，要嘛聽起來像真人，這兩件事往往很難兼顧。許多開發者與影音創作者經常面臨一個頭痛的抉擇，究竟該選擇生成速度極快但聲音充滿機器感的工具，還是花費大量時間等待一個情緒飽滿的音檔。

重點來了，Zyphra 團隊近期帶來了一個相當具震撼力的解決方案。這款名為 ZONOS2 的全新開源文字轉語音模型，正是為了打破這個兩難局面而生。ZONOS2 採用了極具彈性的 Apache 2.0 授權，這代表無論是個人研究還是商業專案都能無縫接軌。它在開源界首度導入了混合專家架構，讓生成的聲音不僅即時，而且克隆出來的語氣、節奏甚至呼吸聲都逼真到令人驚豔。這篇文章將帶大家一探究竟，看看這款模型到底藏了什麼秘密武器。

什麼是混合專家架構？

大家可能會好奇，所謂的混合專家架構（MoE）到底是什麼概念。這邊來解釋一下。想像一家跨國企業裡聘請了各個領域的頂尖顧問。平時這些顧問不會全部同時出動，唯有遇到特定領域的難題時，才會指派最懂那個領域的幾位專家出面解決。這正是 ZONOS2 的運作邏輯。

這款模型總共擁有高達 80 億個參數，但在每一次處理語音生成任務時，它只需要喚醒其中大約 9 億個活躍參數。透過這種聰明的資源分配方式，ZONOS2 成功讓整體的運算吞吐量比前一代足足提升了四倍之多。不但體積變大了，學到的東西變多了，生成速度反而還更快。加上它專門預測 DAC 音訊 Token，這項技術讓輸出的音質直接飆升到 44.1 kHz 的錄音室等級。也就是說，聽眾幾乎無法察覺這是一段由人工智慧生成的合成音。

直接閱讀原始位元組的語言天才

熟悉文字轉語音技術的專家一定知道，過去的模型在發音前，都必須經過一道名為音素化的繁瑣手續。簡單來說，就是先把文字轉換成拼音符號，模型才懂怎麼唸出聲音。但 ZONOS2 決定把這個老規矩丟進垃圾桶。它採用了一種更直觀且更符合直覺的做法，直接讀取輸入文字的 UTF-8 原始位元組。

少了那層轉換手續，ZONOS2 處理語言的靈活度大幅提升。這項改變對於非歐洲語言的使用者來說絕對是一大福音。繁體中文、簡體中文、日文以及韓文等語言，往往因為複雜的發音規則而在音素化過程中吃足苦頭。現在，ZONOS2 將中文與英文、日文並列為最高支援等級的語言。更厲害的是，當遇到中英文夾雜的日常對話場景時，它也能流暢地切換雙語發音，完全不會出現卡頓或發音怪異的窘境。

忠實還原還是完美修飾？雙模式任君挑選

在實際應用語音克隆技術時，大家常常會遇到一個尷尬的狀況。假設今天手邊只有一段充滿背景雜音、錄音環境不佳的參考音檔，模型到底該原汁原味地把雜音一起複製下來，還是該聰明地幫忙過濾掉那些瑕疵？

為了解決這個兩難，ZONOS2 非常貼心地設計了兩種截然不同的生成模式。第一種是表現模式，這個模式的唯一目標就是極致的逼真度。它會緊緊抓住參考音檔裡的所有細節，包含說話者的特殊口吻、高低起伏的韻律，甚至是微小的換氣聲，產生出最自然生動的情感表達。

第二種則是穩定模式。如果使用者只想要一段乾淨清脆、適合直接放入影片中作為旁白的聲音，這個模式就會發揮作用。它會自動修飾掉原始音檔裡的環境噪音與錄音瑕疵，專注於提供高品質、高穩定度的純淨人聲。有了這兩種模式的輔助，創作者可以根據不同的專案需求，靈活調整最終的輸出效果。

龐大訓練數據與全新的評估標準

一款優秀的語音模型背後，必然有著驚人的數據量作為支撐。相比於早期測試版本僅使用大約 20 萬小時的語音資料，ZONOS2 這次一口氣將訓練數據庫擴充到了超過 600 萬小時。這相當於連續播放了 707 年的音訊檔案。這些包羅萬象的語料涵蓋了有聲書的平穩敘事、Podcast 的隨性閒聊，以及各式各樣的多語系對話，讓 ZONOS2 得以適應極度複雜的真實世界語境。

有趣的是，Zyphra 團隊在開發過程中發現了一件事。現今被廣泛使用的語音評估標準，其實已經跟不上技術進步的腳步了。它們大多只針對少數語言進行測試，或者使用的辨識系統過於陳舊。為此，Zyphra 特別設計了一套名為 ZTTS1-Eval 的全新評估基準。這套新標準加入了更多元、更貼近真實情境的吵雜音檔來考驗模型，確保 ZONOS2 在各種嚴苛環境下依然能保持頂尖水準。

豐富的開源資源與實作管道

對於熱愛動手實作的開發者來說，最關心的莫過於如何親自體驗這項技術。Zyphra 團隊在這方面展現了極大的誠意。如果想要將模型整合到自己的伺服器或專案中，大家可以直接前往 Hugging Face 上的 ZONOS2 模型頁面下載完整的模型權重。

同時，官方也在 GitHub 開源了配套的推論程式碼。這套開源專案包含了基於 Mini-SGLang 的高效能伺服器架構，讓有技術背景的使用者能夠輕鬆架設並優化生成流程。有興趣了解程式碼細節的朋友，不妨直接到 ZONOS2 的 GitHub 儲存庫挖寶。

當然，如果只是想先單純體驗一下聲音合成的魅力，也不需要費心設定環境。官方開放了 Zyphra Cloud 語音遊樂場讓大家線上試玩。只要輸入文字、上傳參考音檔，就能立刻感受到這款全新架構帶來的語音震撼。無論是追求極致體驗的影音創作者，還是需要建構低延遲對話系統的開發者，這款工具絕對值得立刻加入技術觀察名單中。

問與答 (Q&A)

Q1：市面上的語音生成工具很多，ZONOS2 最大的技術突破是什麼？ A： ZONOS2 是開源界首款採用「混合專家 (MoE)」架構的文字轉語音模型。它擁有高達 80 億的總參數，但在每次運算時僅需啟動 9 億個活躍參數。這項聰明的設計讓它的吞吐量比前一代大幅提升了 4 倍。此外，它直接預測 DAC 音訊 Token，能夠產出高達 44.1 kHz 的錄音室等級高保真音質。

Q2：ZONOS2 對於非英語（如中文、日文）的發音支援度好嗎？ A：支援度極佳！它捨棄了傳統繁瑣的「音素化」轉換步驟，改為直接閱讀文字的 UTF-8 原始位元組。這項突破大幅增強了處理中文、韓文與日文等非歐洲語言的能力，並且能極度流暢地處理中英文夾雜的對話（語碼轉換）。目前，中文、英文與日文皆被官方列為最高支援等級（Tier 1）。

Q3：如果我用來進行「語音克隆」的參考音檔有背景雜音，模型會怎麼處理？ A：為了應對這個常見難題，ZONOS2 貼心地提供了雙模式切換。如果你選擇「表現模式 (Expressive Mode)」，模型會追求極致的克隆逼真度，忠實還原包含雜音、特殊聲線與呼吸聲的所有細節；若你選擇「穩定模式 (Stable Mode)」，模型則會自動幫你修飾掉環境瑕疵，產出乾淨清脆的錄音室品質語音。

Q4：為什麼官方還要大費周章推出一個名為「ZTTS1-Eval」的全新評估標準？ A： Zyphra 團隊在開發時發現，現今業界常用的評估標準（如 Seed-TTS-Eval）已經過於老舊。舊標準不僅使用的語音辨識模型過時，且多半測試的是缺乏情感起伏的「朗讀語音」。為此，他們推出了 ZTTS1-Eval，引入了包含真實環境噪音與更多元語系的資料集（如 VoxBlink2），藉此更精確地考驗模型在複雜情境下的真實表現。

Q5：這款強大的模型是完全免費的嗎？可以用於商業用途嗎？ A：是的！ZONOS2 採用了極度寬鬆的 Apache 2.0 授權協議進行開源。這代表無論是個人創作者還是企業，都能自由下載模型權重並將其整合到商業專案中。官方甚至大方地在 GitHub 上提供了基於 Mini-SGLang 的高效能推論伺服器程式碼，大大降低了開發者的導入門檻。

分享至:

Featured Partners

SPONSORED

DMflow.chat

DMflow.chat: 您的智能AI夥伴，提升客戶互動、創造卓越體驗。

Learn More

SPONSORED

DMflow.chat

探索DMflow.chat，立即開啟AI驅動的客戶服務新時代。

Learn More

SPONSORED

scribis.app

Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。

Learn More

SPONSORED

videoweaver.app

Video Weaver: 瀏覽器內完成專業影片剪輯，無需下載、即刻創作。

Learn More

SPONSORED

DMflow.chat

DMflow.chat: 您的智能AI夥伴，提升客戶互動、創造卓越體驗。

Learn More

SPONSORED

DMflow.chat

探索DMflow.chat，立即開啟AI驅動的客戶服務新時代。

Learn More

SPONSORED

scribis.app

Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。

Learn More

SPONSORED

videoweaver.app

Video Weaver: 瀏覽器內完成專業影片剪輯，無需下載、即刻創作。

Learn More

Recommended for You

d …

tool

dots.tts 完整解析：拋棄離散 Token 的新一代開源 TTS 語音合成模型

拋棄離散 Token 解析開源語音合成新星 dots.tts 的全連續架構與實用技巧許多人可能會好奇，語音合成技術發展至今，是否已經遇到瓶頸？老實說，開源社群最近出現了一個極具話題性的新面孔，也就是由小紅書（RedNote）推出的 dots.tts。這款模型擁有高達 20 億（2B）參數，並且採用了完全連續（Fully Continuous）的架構設計。這聽起來可能有些抽象，但簡單來說，它完全捨棄了過去常見的離散 Token，讓聲音的生成變得前所未有的滑順自然。對於想要親自體驗這項技術的開發者，可以直接參考 dots.tts 官方展示頁面，或是前往 dots.tts GitHub 專案獲取原始碼。這項專案基於 Apache-2.0 協議開源，這意味著它對商業授權非常友善。接下來，就讓我們一探究竟，看看這個引發熱烈討論的系統到底藏著什麼秘密。為什麼放棄離散 Token？揭開全流程架構的秘密傳統的語音合成系統，多半會採用音訊離散化（Quantization）技術。這就像是把一張高畫質的漸層圖片，強制轉換成只有幾種顏色的 8-bit 像素圖。這個過程無可避免地會流失掉許多細節。 dots.tts 的出現，正是為了解決這個痛點。它採用了一種從文本直接生成連續音訊潛變量的全流程設計。整個運作機制建立在幾個關鍵組件的緊密結合之上：首先是負責處理音訊的 AudioVAE。這是一個以 48kHz 運作的模組，專門把單聲道波形壓縮成連續潛變量，確保最終輸出的聲音保留極高的逼真度與細節。接著是語言模型骨幹（Backbone），它初始化自 Qwen2.5-1.5B-Base。特別的是，這個語言模型不處理傳統的音素（Phoneme），而是直接讀取 BPE 文本，藉此生成對應的隱藏狀態。那麼，要怎麼把文字跟音訊連接起來呢？這裡就得依靠因果語義編碼器（Causal Semantic Encoder）。它會剝離掉聲音中變動性太高、過於瑣碎的聲學細節，讓語言模型能更專注理解整段話的意思與連貫性。最後，再交由自迴歸流匹配頭（AR Flow-matching Head）在連續空間中進行逐塊（Patch-by-patch）的預測與去噪。這種連續建模的方式，徹底避開了量化失真的問題。這確實是一個相當聰明的作法。評測數據說話：這款模型的實力究竟如何？客觀的測試數據往往最能反映真實能力。在 Seed-TTS-Eval 綜合評測中，這款系統在零樣本（Zero-shot）語音克隆的表現相當亮眼。與其他規模相近的模型相比，例如 1.5B 參數的 CosyVoice 3 或是 1.7B 的 Qwen3-TTS，dots.tts 在中文測試集的錯誤率（WER）降到了 0.94%，而平均說話者相似度（SIM）則高達 79.2。這不僅超越了同級別的開源模型，在多語言測試中同樣維持著極高的穩定性。更讓人驚豔的是它在 Emergent-TTS-Eval 評測中的表現力。當面對語法複雜度極高的語句時，它取得了 65.7% 的高分，甚至超越了部分知名的閉源商用系統。同時，在情感表達（Emotions）的項目上，它也拿下了 72.7% 的成績。這意味著生成的語音不再是冷冰冰的機器聲，它能夠捕捉到語氣中的起伏與情緒。三大模型版本總覽：新手該選哪一個？面對官方提供的三種不同權重版本，開發者經常會感到困惑。究竟該如何挑選最適合自己的模型呢？其實分類非常明確。常有人問，如果只想得到最強的語音克隆效果，到底該選哪一個？答案毫無懸念，官方最強烈推薦的是 dots.tts-soar。這個版本經過了自我修正對齊（SCA）的處理，聲音還原度與穩定性都是最高的。如果是為了進行學術研究或是架構驗證，可以選擇基礎預訓練版本 dots.tts-base。那如果設備算力有限，或是極度要求生成速度呢？這時候就可以挑選基於 MeanFlow 知識蒸餾的 dots.tts-mf 學生模型。這個版本預設只需要 4 步就能完成採樣，運行起來非常輕巧且迅速。

Jun 29, 2026 Read →

H …

tool

Higgs Audio v3 TTS 是什麼？支援情感語音、語音複製與 100+ 語言的 AI TTS 技術

聽見真實的情感：Higgs Audio v3 TTS 讓語音 AI 學會真正說話當 AI 代理程式不再只是死板地朗讀文字，對話會變成什麼模樣？本文帶領大家認識這款支援破百種語言、具備行內標籤控制能力的全新語音生成技術。人們總希望機器開口說話時能帶有情感，聽起來更像真人。可是許多現有的文字轉語音系統聽起來總是少了一點人味。它們唸稿的技巧無可挑剔，卻缺乏真實對話中應有的靈魂。說實話，在即時的語音聊天中，說話的節奏與語氣往往比單純把字唸對還要關鍵。這也就是為什麼 Higgs Audio v3 TTS 引起了廣泛討論。這套系統打破了傳統的朗讀框架，專為語音聊天量身打造。這項由 Boson AI 開發的新技術，核心訴求非常明確。它要超越單純的閱讀，走向真實的語音。想像一下日常交流的情境。對話過程包含了許多細微的反應，像是停頓、強調、甚至是情緒的波動。語音不該只附屬在文字生成之後。它本身就是傳遞訊息的主角。系統讓 AI 模型能依據當下情境展現充滿表現力的回應。宛如導演在旁指導的控制標籤這套系統最吸引開發者的特色，絕對是那些被稱為行內控制標籤的強大功能。乍聽之下，行內控制標籤似乎會讓程式碼變得凌亂。畢竟誰會想在對話字串裡塞滿一堆記號？不過實際操作後就會發現，這種設計反而省去了切換系統的麻煩。開發者常常會問：如果要改變聲音情緒，需要跳出文字生成流程嗎？答案是完全不需要。只要直接在字串裡插入特定的標籤，這套系統就能無縫切換各種聲音表現。這就像是一位電影導演站在演員身旁，隨時指示下一句話該用什麼情緒來表達。說到電影，那些經典台詞之所以讓人難忘，往往在於演員的呼吸與停頓拿捏得恰到好處。這些標籤的設計同樣講究細節。想要一點情感波動嗎？它支援多達二十一種細緻的情感設定。喜悅、恐懼或是無助，都能精準傳達。如果需要特殊的人聲風格，直接加入大喊、唱歌或耳語的指令即可。有趣的是，系統還巧妙結合了聲音特效與狀聲詞。當開發者輸入對應的特效標籤後，只要緊跟著加上哈哈大笑或是打噴嚏的狀聲詞（拼音），模型就能精準捕捉發音的聲學提示。這讓咳嗽或嘆氣聽起來無比自然。就連講話的速度與停頓時間，也能精確到毫秒級別。語言天賦與驚人的模仿能力當然，一個優秀的語音模型必須具備強大的語言天賦。這款擁有約四十億個參數的自迴歸解碼器模型，不僅學得快，還學得很精。它具備零樣本語音複製的能力。只要提供一小段參考音訊，系統就能精準捕捉並模仿該聲音的特質。對於許多企業來說，這意味著可以輕鬆建立專屬的品牌語音。許多人會好奇這套系統究竟支援多少種語言。事實上它涵蓋了超過一百種語言。在多達一百零二種語言的測試評估中，它達到了極低的字詞錯誤率。其中高達八十五種語言達到了生產級品質，包含繁體中文、英文與日文等主流語言。這展現了強大的多語處理能力。在激烈競爭中脫穎而出當一項新技術問世，市場總愛拿它跟其他知名系統做比較。在 SeedTTS、CV3 以及 MiniMax-Multilingual 等多語言測試評估裡，它的表現相當亮眼。它成功擊敗了 Fish Audio S2 Pro、Qwen3-TTS 以及 OmniVoice 等強勁對手，創下最低的字詞錯誤率。不過真正讓人驚豔的，是它在 Emergent TTS 評估中的成績。這項評估專門衡量真實對話行為，包含了副語言特徵、疑問句語氣以及複雜的發音細節。系統在情感表達與語氣處理上的勝率全面領先。這證明了它確實懂得如何像真人一樣對話。消除那令人尷尬的等待空白在實用層面，延遲往往是語音 AI 的致命傷。沒有人喜歡在對話時遇到長達數秒的尷尬空白。為了改善這個問題，系統採用了專屬的 Tokenizer，以每幀四十毫秒的速度運行。當它與 SGLang-Omni 伺服器搭配運作時，能夠完美支援連續批次處理與串流生成。開發者只要開啟串流模式，聲碼器產出音訊的瞬間，就會以編碼區塊即時回傳。這使得首字音訊延遲達到了驚人的亞秒級水準。有些人可能會問：這樣的系統該如何部署？商業用途是否需要收費？目前，這款模型的開源權重已經上架於 Hugging Face 資源庫。任何人都可以免費下載進行研究與非商業用途的本地部署。若需商業使用，則需另外向官方取得授權。如果不想經歷繁瑣的本地安裝過程，使用者也可以直接透過 Boson Workspace 在雲端瀏覽器中體驗。挑選喜歡的聲音，輸入測試文字，就能立即感受情緒與停頓標籤帶來的奇妙變化。若是專案需要一個會大笑、會嘆氣、能依據上下文改變語氣的靈魂伴聊，這項技術絕對值得花時間好好探索。問與答 Q1：Higgs Audio v3 TTS 與傳統的文字轉語音（TTS）系統有何不同？ A：傳統的 TTS 系統主要設計來「朗讀」文字，而 Higgs Audio v3 TTS 則是專為「語音聊天（Voice chat）」所打造。它不僅能讀出文字，還能將語言模型的回應轉化為充滿表現力的真實對話語音，根據上下文自然展現情緒、停頓與語氣變化，使 AI 代理程式聽起來更像真人交流。

Jun 5, 2026 Read →

A …

tool

AI 語音不再像機器人！解析 MOSS-TTS-v1.5 的 31 國語言與精確停頓控制

AI 語音不再像機器人！解析 MOSS-TTS-v1.5 的 31 國語言與精確停頓控制老實說，現在的語音合成技術已經相當普及。打開影音平台，隨處可以聽見流暢的 AI 解說。不過大家往往會發現一個小毛病。這些聲音聽起來太過「完美」，反而缺少了人類說話時特有的呼吸感與節奏感。AI 雖然字正腔圓，卻缺乏感情，往往不懂得在關鍵時刻停頓來營造戲劇張力。為了解決這項痛點，開發團隊釋出了全新的 MOSS-TTS-v1.5 語音合成模型。這款擁有 80 億參數的強大開源工具，不僅繼承了上一代的優良基礎，更加入了多項讓人眼睛一亮的實用升級。接下來將為大家梳理這款模型究竟帶來了哪些關鍵突破。掌握情緒節奏：導演等級的精確停頓機制人類在演講或說故事時，常常會刻意停頓。適當的留白能夠營造懸念。然而傳統的 TTS 模型很難做到這一點。開發人員通常只能盲目地塞入逗號或句號，祈禱 AI 能夠在正確的地方換氣。這款新模型徹底改變了這個遊戲規則。它引入了一項名為「顯式停頓控制」的驚豔功能，這也是本次更新中最受矚目的升級之一。使用者只要在腳本中加入類似 [pause 3.2s] 的標記，AI 就會乖乖照做。舉個生活化的例子。當腳本寫著：「今天學習了一首中國古詩，它的名字是 [pause 3.2s] 靜夜思！」系統便會在揭曉詩名前，精準地安靜 3.2 秒。這樣的節奏感讓合成語音瞬間擁有了靈魂，聽起來就像真實人類在說話。不僅如此，新版模型也強化了跟隨標點符號的韻律表現。處理長篇大論時，換氣與停頓變得更加自然流暢。跨越語言藩籬：一口氣支援 31 種語言與專屬標籤目前的數位創作環境極度需要多國語言的支援。MOSS-TTS-v1.5 將語言庫從原先的 20 種大幅擴充。現在它支援高達 31 種語言。除了大家熟悉的英文、日文與韓文之外，這次特別加入了粵語、荷蘭語、芬蘭語、印地語、馬來語、羅馬尼亞語、斯瓦希里語、泰語以及越南語。有趣的是，模型還變得更聰明了。為了讓發音更道地，開發團隊引入了「語言標籤」機制。只要在程式碼中明確指定語系，例如設定 language="French"，AI 就能產出極具母語人士口音的法語發音。這種明確指定標籤的做法，有效解決了多語言混合時容易發生的錯亂問題，讓外語發音效果達到極佳的狀態。告別隨機誤差：穩定性極高的零樣本語音復刻曾嘗試過語音復刻的創作者大概都有過類似的困擾。拿同一段錄音去生成聲音，每次出來的音色總是有點不一樣。這其實非常消耗耐心。新版本針對這個痛點進行了徹底的底層優化。它大幅提升了模仿說話者音色的相似度，並且有效降低了每次生成時的變異性。這意味著生成的聲音品質將保持高度一致。高度一致的品質，正是專業製作中最不可或缺的一環。這裡還有一個值得一提的技術突破。有時候使用者手邊只有一段很長的參考音訊，卻只打算讓 AI 講一句極短的台詞。面對這種長短嚴重不對稱的情境，舊版模型可能會出現失真現象。新版模型則完美克服了這項挑戰。它特別針對「長參考音訊與短目標文本」的情境進行優化，現在能夠非常可靠且穩定地處理這類極端的語音復刻任務，再也不用擔心系統會當機或產出奇怪的雜音。擁抱開源社群：彈性授權與硬體效能最佳化好的技術若能普及，影響力將會無限放大。如同先前的版本，這款新模型採用了極具彈性的 Apache 2.0 開源授權協議。這代表無論是學術研究還是商業產品化，任何人都能完全免費且自由地使用這款強大的模型。談到硬體規格，這款 80 億參數的模型預設採用 BF16 精度來運作，建議在配備獨立 GPU 的環境下執行。為了讓生成速度更快，官方強烈建議在支援的硬體上安裝並啟用 FlashAttention 2 加速技術。這項設定不僅能有效提升運算效率，還能大幅降低顯示卡記憶體的佔用率。對於需要大量生成語音內容的團隊來說，絕對是一大福音。綜合來看，這款語音合成模型成功跨越了過去常見的技術門檻。藉由細膩的停頓控制與穩定的復刻能力，未來的數位聲音將會變得更加生動有趣。問與答 (Q&A) Q1：MOSS-TTS-v1.5 相比其他語音模型，最大的特色是什麼？如何讓 AI 聽起來不呆板？ A：最大的突破在於加入了「顯式停頓控制（Explicit pause control）」。使用者只要在文字中加入如 [pause 3.2s] 的標籤，AI 就會精準停頓指定的秒數。此外，它也大幅強化了跟隨標點符號的韻律感，讓長篇大論時的換氣與節奏更像真實人類在說話。

May 27, 2026 Read →

Zyphra 推出 ZONOS2：首款 MoE 即時 TTS 語音克隆模型，支援中文與商用開源

Zyphra 推出 ZONOS2：首創 MoE 架構的即時 TTS 語音克隆模型

什麼是混合專家架構？

直接閱讀原始位元組的語言天才

忠實還原還是完美修飾？雙模式任君挑選

龐大訓練數據與全新的評估標準

豐富的開源資源與實作管道

問與答 (Q&A)

DMflow.chat

DMflow.chat

scribis.app

videoweaver.app

DMflow.chat

DMflow.chat

scribis.app

videoweaver.app

Recommended for You

dots.tts 完整解析：拋棄離散 Token 的新一代開源 TTS 語音合成模型

Higgs Audio v3 TTS 是什麼？支援情感語音、語音複製與 100+ 語言的 AI TTS 技術

AI 語音不再像機器人！解析 MOSS-TTS-v1.5 的 31 國語言與精確停頓控制

Leaving Website