dots.tts 完整解析：拋棄離散 Token 的新一代開源 TTS 語音合成模型

拋棄離散 Token 解析開源語音合成新星 dots.tts 的全連續架構與實用技巧

許多人可能會好奇，語音合成技術發展至今，是否已經遇到瓶頸？老實說，開源社群最近出現了一個極具話題性的新面孔，也就是由小紅書（RedNote）推出的 dots.tts。這款模型擁有高達 20 億（2B）參數，並且採用了完全連續（Fully Continuous）的架構設計。這聽起來可能有些抽象，但簡單來說，它完全捨棄了過去常見的離散 Token，讓聲音的生成變得前所未有的滑順自然。

對於想要親自體驗這項技術的開發者，可以直接參考 dots.tts 官方展示頁面，或是前往 dots.tts GitHub 專案獲取原始碼。這項專案基於 Apache-2.0 協議開源，這意味著它對商業授權非常友善。

接下來，就讓我們一探究竟，看看這個引發熱烈討論的系統到底藏著什麼秘密。

為什麼放棄離散 Token？揭開全流程架構的秘密

傳統的語音合成系統，多半會採用音訊離散化（Quantization）技術。這就像是把一張高畫質的漸層圖片，強制轉換成只有幾種顏色的 8-bit 像素圖。這個過程無可避免地會流失掉許多細節。

dots.tts 的出現，正是為了解決這個痛點。它採用了一種從文本直接生成連續音訊潛變量的全流程設計。整個運作機制建立在幾個關鍵組件的緊密結合之上：

首先是負責處理音訊的 AudioVAE。這是一個以 48kHz 運作的模組，專門把單聲道波形壓縮成連續潛變量，確保最終輸出的聲音保留極高的逼真度與細節。接著是語言模型骨幹（Backbone），它初始化自 Qwen2.5-1.5B-Base。特別的是，這個語言模型不處理傳統的音素（Phoneme），而是直接讀取 BPE 文本，藉此生成對應的隱藏狀態。

那麼，要怎麼把文字跟音訊連接起來呢？這裡就得依靠因果語義編碼器（Causal Semantic Encoder）。它會剝離掉聲音中變動性太高、過於瑣碎的聲學細節，讓語言模型能更專注理解整段話的意思與連貫性。最後，再交由自迴歸流匹配頭（AR Flow-matching Head）在連續空間中進行逐塊（Patch-by-patch）的預測與去噪。

這種連續建模的方式，徹底避開了量化失真的問題。這確實是一個相當聰明的作法。

評測數據說話：這款模型的實力究竟如何？

客觀的測試數據往往最能反映真實能力。在 Seed-TTS-Eval 綜合評測中，這款系統在零樣本（Zero-shot）語音克隆的表現相當亮眼。

與其他規模相近的模型相比，例如 1.5B 參數的 CosyVoice 3 或是 1.7B 的 Qwen3-TTS，dots.tts 在中文測試集的錯誤率（WER）降到了 0.94%，而平均說話者相似度（SIM）則高達 79.2。這不僅超越了同級別的開源模型，在多語言測試中同樣維持著極高的穩定性。

更讓人驚豔的是它在 Emergent-TTS-Eval 評測中的表現力。當面對語法複雜度極高的語句時，它取得了 65.7% 的高分，甚至超越了部分知名的閉源商用系統。同時，在情感表達（Emotions）的項目上，它也拿下了 72.7% 的成績。這意味著生成的語音不再是冷冰冰的機器聲，它能夠捕捉到語氣中的起伏與情緒。

三大模型版本總覽：新手該選哪一個？

面對官方提供的三種不同權重版本，開發者經常會感到困惑。究竟該如何挑選最適合自己的模型呢？其實分類非常明確。

常有人問，如果只想得到最強的語音克隆效果，到底該選哪一個？答案毫無懸念，官方最強烈推薦的是 dots.tts-soar。這個版本經過了自我修正對齊（SCA）的處理，聲音還原度與穩定性都是最高的。

如果是為了進行學術研究或是架構驗證，可以選擇基礎預訓練版本 dots.tts-base。

那如果設備算力有限，或是極度要求生成速度呢？這時候就可以挑選基於 MeanFlow 知識蒸餾的 dots.tts-mf 學生模型。這個版本預設只需要 4 步就能完成採樣，運行起來非常輕巧且迅速。

實戰演練：避開常見陷阱的操作建議

掌握了理論，接下來的實作環節同樣充滿學問。要讓系統發揮出最佳潛力，有一些操作上的細節絕對不能忽略。

在進行零樣本克隆時，系統提供兩種主要的模式。第一種是「續讀模式（Continuation Mode）」，這是獲取最高相似度的首選。只要提供一段參考音訊，並輸入這段音訊對應的精確文字，模型就能完美接續著原本的語氣繼續說話。第二種則是「純向量模式（X-vector-only Mode）」，這種模式只需要提供參考音訊，模型就會自動提取說話人的音色特徵來生成新的內容。

在準備提示音訊（Prompt Audio）時，長度最好控制在 10 秒左右就好。很多人以為音訊越長越好，這其實是個誤解。過長的音訊反而可能干擾生成過程。此外，必須確保音質清晰無背景噪音。

另一個大家常遇到的困擾是，為什麼模型有時候會唸錯多音字？遇到這種情況，千萬不要去改動底層程式碼。最簡單有效的解決方式，就是直接在輸入的文本中把那個字替換成帶有音調的拼音。例如把「好」寫成「hào」。請特別注意，不要加上數字來標音（像 hao4 是無效的），必須使用標準的聲調符號。

如果對生成的語氣或節奏不滿意，只要透過更換指令中的 --seed 數值，模型就會給出截然不同的抑揚頓挫。多試幾次，總能找到最順耳的版本。

活躍的社群支援與不可忽視的限制

一個開源專案能否長遠發展，社群的活躍度扮演著關鍵角色。目前，社群已經為這款模型開發了專屬的 Apple Silicon 最佳化版本（包含 dots-tts-mlx 與 mlx-swift-dots-tts），讓 iOS 與 macOS 使用者也能輕鬆部署。喜歡圖形化介面的創作者，也可以找到對應的 ComfyUI 擴充節點。

當然，任何技術都有其限制。因為底層依賴 BPE 文本模型，在處理資料量較少的長尾語言（例如阿拉伯語、印地語或是越南語）時，雖然聲音的相似度不受影響，但文字錯誤率的確會偏高。此外，它的訓練資料全數集中在語音上，目前並不具備生成歌聲或是特殊音效的能力。

最後，伴隨著強大克隆能力而來的，是不可迴避的安全與倫理責任。這項技術生成的聲音極度逼真，開發者在使用時務必加上 AI 生成標記與浮水印，絕不可將其用於任何未經同意的偽造或詐騙行為。

dots.tts 確實為語音生成領域帶來了全新的思考方向。透過捨棄離散 Token，它成功保留了音訊的豐富細節，展現了極高的相似度與情感表現，也讓人對未來的語音互動應用充滿期待。

問與答

Q1：什麼是 dots.tts？它最大的特色是什麼？ A1：dots.tts 是一個擁有 20 億（2B）參數的全連續、端到端自迴歸（AR）文字轉語音系統。它最大的創新在於整個流程完全不使用「離散 Token」。其架構底層結合了因果語義編碼器、基於 Qwen2.5 的大型語言模型（LLM），以及自迴歸流匹配（Flow-matching）聲學頭，並搭配 48kHz 的 AudioVAE 來確保極高的音訊還原度。

Q2：官方釋出了三個不同版本的模型（base, soar, mf），我該怎麼選？ A2：

dots.tts-base：基礎的預訓練版本。
dots.tts-soar：經過自我修正對齊（SCA）處理的版本。官方最推薦，擁有最強的語音克隆（Voice Cloning）與情感表現能力。
dots.tts-mf：基於 MeanFlow 知識蒸餾技術的學生模型。如果你非常在意推理速度與算力消耗，建議選擇此版本，預設只需要 4 步採樣即可完成生成。

Q3：進行語音克隆時，提示音頻（Prompt Audio）要多長比較好？ A3：建議將提示音頻的長度控制在 10 秒左右。音頻太長並不會帶來更好的結果，反而可能浪費算力。此外，必須確保音頻的「文字稿（Prompt Text）」與實際說出的內容完全一致，否則會影響生成穩定度，甚至導致字詞層級的錯誤。

Q4：如果模型唸錯多音字，該如何解決？ A4：你可以直接在輸入文本中，將該中文字替換為「帶有聲調符號的拼音」來強制校正發音。例如，想要強制將「好」發音為四聲，應寫作 hào。請特別注意，系統只支援正規的聲調符號（如 hǎo, hào），不支援數字標音（例如輸入 hao4 是無效的）。

Q5：如果對生成的語音節奏或音質不滿意怎麼辦？ A5：你可以嘗試更換指令中的 --seed（隨機種子）數值。不同的種子會產生截然不同的節奏與語調，多試幾次通常就能找到最適合的版本。若覺得音質還不夠理想，可以調高 --num-steps 來增加採樣步數，藉由增加運算量來換取更乾淨、表現力更好的音質。

Q6：dots.tts 支援多語言和低延遲串流嗎？ A6：支援。在處理多語言或中英夾雜時，可以使用 --language auto_detect 讓系統自動偵測，或是強制指定特定語言（如 EN, ZH）。此外，系統架構支援低延遲的串流生成（Streaming），能夠逐塊輸出音訊，非常適合與對話式語言模型結合應用。

Q7：dots.tts 有什麼技術限制或需要注意的倫理風險嗎？ A7：

技術限制：雖然音色克隆能力極強，但在處理資料量較少的長尾語言（如阿拉伯語、印地語、越南語等）時，文字錯誤率（WER）會偏高。另外，目前的訓練資料以語音為主，尚無法生成唱歌或特殊的聲音特效。
倫理風險：由於其零樣本（Zero-shot）語音克隆極度逼真，官方強烈要求使用時必須明確標示為「AI 生成」，並且嚴禁將其用於未經同意的偽造、詐騙或散佈假訊息。專案採用 Apache-2.0 協議開源，適合研究與合法授權的商業部署。

分享至:

Featured Partners

SPONSORED

scribis.app

Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。

Learn More

SPONSORED

videoweaver.app

Video Weaver: 瀏覽器內完成專業影片剪輯，無需下載、即刻創作。

Learn More

SPONSORED

DMflow.chat

探索DMflow.chat，立即開啟AI驅動的客戶服務新時代。

Learn More

SPONSORED

DMflow.chat

DMflow.chat: 您的智能AI夥伴，提升客戶互動、創造卓越體驗。

Learn More

SPONSORED

scribis.app

Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。

Learn More

SPONSORED

videoweaver.app

Video Weaver: 瀏覽器內完成專業影片剪輯，無需下載、即刻創作。

Learn More

SPONSORED

DMflow.chat

探索DMflow.chat，立即開啟AI驅動的客戶服務新時代。

Learn More

SPONSORED

DMflow.chat

DMflow.chat: 您的智能AI夥伴，提升客戶互動、創造卓越體驗。

Learn More

Recommended for You

Z …

tool

Zyphra 推出 ZONOS2：首款 MoE 即時 TTS 語音克隆模型，支援中文與商用開源

Zyphra 推出 ZONOS2：首創 MoE 架構的即時 TTS 語音克隆模型 Zyphra 最新推出的 ZONOS2 是一款採用 Apache 2.0 授權的開源文字轉語音模型。首創導入混合專家架構，不僅達成低延遲語音生成，更具備極高逼真度的語音克隆能力，並支援中英日等多國語言。大家或許都有過這樣的經驗。在人工智慧語音生成的圈子裡，要嘛跑得快，要嘛聽起來像真人，這兩件事往往很難兼顧。許多開發者與影音創作者經常面臨一個頭痛的抉擇，究竟該選擇生成速度極快但聲音充滿機器感的工具，還是花費大量時間等待一個情緒飽滿的音檔。重點來了，Zyphra 團隊近期帶來了一個相當具震撼力的解決方案。這款名為 ZONOS2 的全新開源文字轉語音模型，正是為了打破這個兩難局面而生。ZONOS2 採用了極具彈性的 Apache 2.0 授權，這代表無論是個人研究還是商業專案都能無縫接軌。它在開源界首度導入了混合專家架構，讓生成的聲音不僅即時，而且克隆出來的語氣、節奏甚至呼吸聲都逼真到令人驚豔。這篇文章將帶大家一探究竟，看看這款模型到底藏了什麼秘密武器。什麼是混合專家架構？大家可能會好奇，所謂的混合專家架構（MoE）到底是什麼概念。這邊來解釋一下。想像一家跨國企業裡聘請了各個領域的頂尖顧問。平時這些顧問不會全部同時出動，唯有遇到特定領域的難題時，才會指派最懂那個領域的幾位專家出面解決。這正是 ZONOS2 的運作邏輯。這款模型總共擁有高達 80 億個參數，但在每一次處理語音生成任務時，它只需要喚醒其中大約 9 億個活躍參數。透過這種聰明的資源分配方式，ZONOS2 成功讓整體的運算吞吐量比前一代足足提升了四倍之多。不但體積變大了，學到的東西變多了，生成速度反而還更快。加上它專門預測 DAC 音訊 Token，這項技術讓輸出的音質直接飆升到 44.1 kHz 的錄音室等級。也就是說，聽眾幾乎無法察覺這是一段由人工智慧生成的合成音。直接閱讀原始位元組的語言天才熟悉文字轉語音技術的專家一定知道，過去的模型在發音前，都必須經過一道名為音素化的繁瑣手續。簡單來說，就是先把文字轉換成拼音符號，模型才懂怎麼唸出聲音。但 ZONOS2 決定把這個老規矩丟進垃圾桶。它採用了一種更直觀且更符合直覺的做法，直接讀取輸入文字的 UTF-8 原始位元組。少了那層轉換手續，ZONOS2 處理語言的靈活度大幅提升。這項改變對於非歐洲語言的使用者來說絕對是一大福音。繁體中文、簡體中文、日文以及韓文等語言，往往因為複雜的發音規則而在音素化過程中吃足苦頭。現在，ZONOS2 將中文與英文、日文並列為最高支援等級的語言。更厲害的是，當遇到中英文夾雜的日常對話場景時，它也能流暢地切換雙語發音，完全不會出現卡頓或發音怪異的窘境。忠實還原還是完美修飾？雙模式任君挑選在實際應用語音克隆技術時，大家常常會遇到一個尷尬的狀況。假設今天手邊只有一段充滿背景雜音、錄音環境不佳的參考音檔，模型到底該原汁原味地把雜音一起複製下來，還是該聰明地幫忙過濾掉那些瑕疵？為了解決這個兩難，ZONOS2 非常貼心地設計了兩種截然不同的生成模式。第一種是表現模式，這個模式的唯一目標就是極致的逼真度。它會緊緊抓住參考音檔裡的所有細節，包含說話者的特殊口吻、高低起伏的韻律，甚至是微小的換氣聲，產生出最自然生動的情感表達。第二種則是穩定模式。如果使用者只想要一段乾淨清脆、適合直接放入影片中作為旁白的聲音，這個模式就會發揮作用。它會自動修飾掉原始音檔裡的環境噪音與錄音瑕疵，專注於提供高品質、高穩定度的純淨人聲。有了這兩種模式的輔助，創作者可以根據不同的專案需求，靈活調整最終的輸出效果。龐大訓練數據與全新的評估標準一款優秀的語音模型背後，必然有著驚人的數據量作為支撐。相比於早期測試版本僅使用大約 20 萬小時的語音資料，ZONOS2 這次一口氣將訓練數據庫擴充到了超過 600 萬小時。這相當於連續播放了 707 年的音訊檔案。這些包羅萬象的語料涵蓋了有聲書的平穩敘事、Podcast 的隨性閒聊，以及各式各樣的多語系對話，讓 ZONOS2 得以適應極度複雜的真實世界語境。有趣的是，Zyphra 團隊在開發過程中發現了一件事。現今被廣泛使用的語音評估標準，其實已經跟不上技術進步的腳步了。它們大多只針對少數語言進行測試，或者使用的辨識系統過於陳舊。為此，Zyphra 特別設計了一套名為 ZTTS1-Eval 的全新評估基準。這套新標準加入了更多元、更貼近真實情境的吵雜音檔來考驗模型，確保 ZONOS2 在各種嚴苛環境下依然能保持頂尖水準。

Jun 15, 2026 Read →

H …

tool

Higgs Audio v3 TTS 是什麼？支援情感語音、語音複製與 100+ 語言的 AI TTS 技術

聽見真實的情感：Higgs Audio v3 TTS 讓語音 AI 學會真正說話當 AI 代理程式不再只是死板地朗讀文字，對話會變成什麼模樣？本文帶領大家認識這款支援破百種語言、具備行內標籤控制能力的全新語音生成技術。人們總希望機器開口說話時能帶有情感，聽起來更像真人。可是許多現有的文字轉語音系統聽起來總是少了一點人味。它們唸稿的技巧無可挑剔，卻缺乏真實對話中應有的靈魂。說實話，在即時的語音聊天中，說話的節奏與語氣往往比單純把字唸對還要關鍵。這也就是為什麼 Higgs Audio v3 TTS 引起了廣泛討論。這套系統打破了傳統的朗讀框架，專為語音聊天量身打造。這項由 Boson AI 開發的新技術，核心訴求非常明確。它要超越單純的閱讀，走向真實的語音。想像一下日常交流的情境。對話過程包含了許多細微的反應，像是停頓、強調、甚至是情緒的波動。語音不該只附屬在文字生成之後。它本身就是傳遞訊息的主角。系統讓 AI 模型能依據當下情境展現充滿表現力的回應。宛如導演在旁指導的控制標籤這套系統最吸引開發者的特色，絕對是那些被稱為行內控制標籤的強大功能。乍聽之下，行內控制標籤似乎會讓程式碼變得凌亂。畢竟誰會想在對話字串裡塞滿一堆記號？不過實際操作後就會發現，這種設計反而省去了切換系統的麻煩。開發者常常會問：如果要改變聲音情緒，需要跳出文字生成流程嗎？答案是完全不需要。只要直接在字串裡插入特定的標籤，這套系統就能無縫切換各種聲音表現。這就像是一位電影導演站在演員身旁，隨時指示下一句話該用什麼情緒來表達。說到電影，那些經典台詞之所以讓人難忘，往往在於演員的呼吸與停頓拿捏得恰到好處。這些標籤的設計同樣講究細節。想要一點情感波動嗎？它支援多達二十一種細緻的情感設定。喜悅、恐懼或是無助，都能精準傳達。如果需要特殊的人聲風格，直接加入大喊、唱歌或耳語的指令即可。有趣的是，系統還巧妙結合了聲音特效與狀聲詞。當開發者輸入對應的特效標籤後，只要緊跟著加上哈哈大笑或是打噴嚏的狀聲詞（拼音），模型就能精準捕捉發音的聲學提示。這讓咳嗽或嘆氣聽起來無比自然。就連講話的速度與停頓時間，也能精確到毫秒級別。語言天賦與驚人的模仿能力當然，一個優秀的語音模型必須具備強大的語言天賦。這款擁有約四十億個參數的自迴歸解碼器模型，不僅學得快，還學得很精。它具備零樣本語音複製的能力。只要提供一小段參考音訊，系統就能精準捕捉並模仿該聲音的特質。對於許多企業來說，這意味著可以輕鬆建立專屬的品牌語音。許多人會好奇這套系統究竟支援多少種語言。事實上它涵蓋了超過一百種語言。在多達一百零二種語言的測試評估中，它達到了極低的字詞錯誤率。其中高達八十五種語言達到了生產級品質，包含繁體中文、英文與日文等主流語言。這展現了強大的多語處理能力。在激烈競爭中脫穎而出當一項新技術問世，市場總愛拿它跟其他知名系統做比較。在 SeedTTS、CV3 以及 MiniMax-Multilingual 等多語言測試評估裡，它的表現相當亮眼。它成功擊敗了 Fish Audio S2 Pro、Qwen3-TTS 以及 OmniVoice 等強勁對手，創下最低的字詞錯誤率。不過真正讓人驚豔的，是它在 Emergent TTS 評估中的成績。這項評估專門衡量真實對話行為，包含了副語言特徵、疑問句語氣以及複雜的發音細節。系統在情感表達與語氣處理上的勝率全面領先。這證明了它確實懂得如何像真人一樣對話。消除那令人尷尬的等待空白在實用層面，延遲往往是語音 AI 的致命傷。沒有人喜歡在對話時遇到長達數秒的尷尬空白。為了改善這個問題，系統採用了專屬的 Tokenizer，以每幀四十毫秒的速度運行。當它與 SGLang-Omni 伺服器搭配運作時，能夠完美支援連續批次處理與串流生成。開發者只要開啟串流模式，聲碼器產出音訊的瞬間，就會以編碼區塊即時回傳。這使得首字音訊延遲達到了驚人的亞秒級水準。有些人可能會問：這樣的系統該如何部署？商業用途是否需要收費？目前，這款模型的開源權重已經上架於 Hugging Face 資源庫。任何人都可以免費下載進行研究與非商業用途的本地部署。若需商業使用，則需另外向官方取得授權。如果不想經歷繁瑣的本地安裝過程，使用者也可以直接透過 Boson Workspace 在雲端瀏覽器中體驗。挑選喜歡的聲音，輸入測試文字，就能立即感受情緒與停頓標籤帶來的奇妙變化。若是專案需要一個會大笑、會嘆氣、能依據上下文改變語氣的靈魂伴聊，這項技術絕對值得花時間好好探索。問與答 Q1：Higgs Audio v3 TTS 與傳統的文字轉語音（TTS）系統有何不同？ A：傳統的 TTS 系統主要設計來「朗讀」文字，而 Higgs Audio v3 TTS 則是專為「語音聊天（Voice chat）」所打造。它不僅能讀出文字，還能將語言模型的回應轉化為充滿表現力的真實對話語音，根據上下文自然展現情緒、停頓與語氣變化，使 AI 代理程式聽起來更像真人交流。

Jun 5, 2026 Read →

A …

tool

AI 語音不再像機器人！解析 MOSS-TTS-v1.5 的 31 國語言與精確停頓控制

AI 語音不再像機器人！解析 MOSS-TTS-v1.5 的 31 國語言與精確停頓控制老實說，現在的語音合成技術已經相當普及。打開影音平台，隨處可以聽見流暢的 AI 解說。不過大家往往會發現一個小毛病。這些聲音聽起來太過「完美」，反而缺少了人類說話時特有的呼吸感與節奏感。AI 雖然字正腔圓，卻缺乏感情，往往不懂得在關鍵時刻停頓來營造戲劇張力。為了解決這項痛點，開發團隊釋出了全新的 MOSS-TTS-v1.5 語音合成模型。這款擁有 80 億參數的強大開源工具，不僅繼承了上一代的優良基礎，更加入了多項讓人眼睛一亮的實用升級。接下來將為大家梳理這款模型究竟帶來了哪些關鍵突破。掌握情緒節奏：導演等級的精確停頓機制人類在演講或說故事時，常常會刻意停頓。適當的留白能夠營造懸念。然而傳統的 TTS 模型很難做到這一點。開發人員通常只能盲目地塞入逗號或句號，祈禱 AI 能夠在正確的地方換氣。這款新模型徹底改變了這個遊戲規則。它引入了一項名為「顯式停頓控制」的驚豔功能，這也是本次更新中最受矚目的升級之一。使用者只要在腳本中加入類似 [pause 3.2s] 的標記，AI 就會乖乖照做。舉個生活化的例子。當腳本寫著：「今天學習了一首中國古詩，它的名字是 [pause 3.2s] 靜夜思！」系統便會在揭曉詩名前，精準地安靜 3.2 秒。這樣的節奏感讓合成語音瞬間擁有了靈魂，聽起來就像真實人類在說話。不僅如此，新版模型也強化了跟隨標點符號的韻律表現。處理長篇大論時，換氣與停頓變得更加自然流暢。跨越語言藩籬：一口氣支援 31 種語言與專屬標籤目前的數位創作環境極度需要多國語言的支援。MOSS-TTS-v1.5 將語言庫從原先的 20 種大幅擴充。現在它支援高達 31 種語言。除了大家熟悉的英文、日文與韓文之外，這次特別加入了粵語、荷蘭語、芬蘭語、印地語、馬來語、羅馬尼亞語、斯瓦希里語、泰語以及越南語。有趣的是，模型還變得更聰明了。為了讓發音更道地，開發團隊引入了「語言標籤」機制。只要在程式碼中明確指定語系，例如設定 language="French"，AI 就能產出極具母語人士口音的法語發音。這種明確指定標籤的做法，有效解決了多語言混合時容易發生的錯亂問題，讓外語發音效果達到極佳的狀態。告別隨機誤差：穩定性極高的零樣本語音復刻曾嘗試過語音復刻的創作者大概都有過類似的困擾。拿同一段錄音去生成聲音，每次出來的音色總是有點不一樣。這其實非常消耗耐心。新版本針對這個痛點進行了徹底的底層優化。它大幅提升了模仿說話者音色的相似度，並且有效降低了每次生成時的變異性。這意味著生成的聲音品質將保持高度一致。高度一致的品質，正是專業製作中最不可或缺的一環。這裡還有一個值得一提的技術突破。有時候使用者手邊只有一段很長的參考音訊，卻只打算讓 AI 講一句極短的台詞。面對這種長短嚴重不對稱的情境，舊版模型可能會出現失真現象。新版模型則完美克服了這項挑戰。它特別針對「長參考音訊與短目標文本」的情境進行優化，現在能夠非常可靠且穩定地處理這類極端的語音復刻任務，再也不用擔心系統會當機或產出奇怪的雜音。擁抱開源社群：彈性授權與硬體效能最佳化好的技術若能普及，影響力將會無限放大。如同先前的版本，這款新模型採用了極具彈性的 Apache 2.0 開源授權協議。這代表無論是學術研究還是商業產品化，任何人都能完全免費且自由地使用這款強大的模型。談到硬體規格，這款 80 億參數的模型預設採用 BF16 精度來運作，建議在配備獨立 GPU 的環境下執行。為了讓生成速度更快，官方強烈建議在支援的硬體上安裝並啟用 FlashAttention 2 加速技術。這項設定不僅能有效提升運算效率，還能大幅降低顯示卡記憶體的佔用率。對於需要大量生成語音內容的團隊來說，絕對是一大福音。綜合來看，這款語音合成模型成功跨越了過去常見的技術門檻。藉由細膩的停頓控制與穩定的復刻能力，未來的數位聲音將會變得更加生動有趣。問與答 (Q&A) Q1：MOSS-TTS-v1.5 相比其他語音模型，最大的特色是什麼？如何讓 AI 聽起來不呆板？ A：最大的突破在於加入了「顯式停頓控制（Explicit pause control）」。使用者只要在文字中加入如 [pause 3.2s] 的標籤，AI 就會精準停頓指定的秒數。此外，它也大幅強化了跟隨標點符號的韻律感，讓長篇大論時的換氣與節奏更像真實人類在說話。

May 27, 2026 Read →