tool

Audio8_TTS:輕量化高效能語音合成技術的全新突破

September 13, 2026
Updated Sep 13
2 min read
Audio8_TTS:輕量化高效能語音合成技術的全新突破

語音合成新紀元:Audio8_TTS 技術解析

近期開源專案 Audio8_TTS 引起開發者廣泛討論。這個文字轉語音(TTS)模型不以盲目堆疊參數為目標,而是透過精妙的架構創新與壓縮,在僅有 0.6B(6 億參數)與 0.1B(1 億參數) 的輕量極小規模下,實現了可與數十億參數工業級模型抗衡的 Zero-Shot 零樣本語音克隆(Voice Cloning) 品質與推論效率。

圖片來源: GitHub - Edge0-AI/Audio8_TTS: SOTA-Class TTS at Compact Scale · GitHub

核心技術:DualAR 架構與 Mamba 2 混合骨幹

Audio8_TTS 的核心優勢在於其靈活且高效的模型架構設計,並針對不同尺寸版本進行了專屬優化:

  • DualAR 雙自回歸解碼架構: 主要模型(0.6B)靈感源自 Fish Audio S2 Pro,分為負責生成語義 token 的 Slow AR(慢速自回歸,24 層),以及受 Slow hidden state 指導並生成 10 個聲學 Codebook 的 Fast AR(快速自回歸,4 層)。模型內建 44.1 kHz 神經聲碼器(Neural Codec),無需額外掛載解碼模型。
  • 0.1B 版本的 Falcon-H1 混合骨幹: 針對極致輕量化與長序列效率設計的 0.1B 版本,將 Slow AR 骨幹替換為 Falcon-H1 混合架構(Mamba 2 SSM + 注意力機制),能顯著降低記憶體開銷並提升長文本處理效率。
  • 多語言 Zero-Shot 語音克隆: 官方推薦支援包含中文、粵語、英文、日文、韓文、法文、德文、西班牙文、義大利文、波蘭文與荷蘭文等 11 種主要語言,只需提供一段短暫的參考音檔與文字稿,即可精準擷取目標音色。

開發者支援與環境

該專案在 GitHub 上提供了極為完整的生態系與部署工具,降低了整合難度:

  • CPU 純 ONNX Runtime 輕量部署: 提供權重僅 INT4 量化的 Slow/Fast AR 模型,可在 CPU 上獨立運行(如 macOS 或 Windows PowerShell 環境),記憶體佔用極低(Apple M2 環境僅約 1 GiB),且無需依賴 PyTorch 或 Transformers 庫。
  • SGLang Omni 伺服器級高併發支援: 整合 SGLang Omni 框架,原生支援 OpenAI 格式 API(/v1/audio/speech)、Paged Attention 與分頁快取,並支援 SSE 即時串流音訊輸出(PCM/WAV)。在 NVIDIA H20 GPU 上實測首字與生成延遲極低,RTF(即時率)可達 0.116(約 8.6 倍速生成)。
  • 顯示卡硬體自適應: 在 Hopper 架構 GPU(如 H20, H100)上預設調用 FlashAttention-3(FA3),針對 Blackwell 系列消費級顯示卡(如 RTX 5090)則自動切換至 FlashInfer 引擎。
  • 工具腳本: 專案隨附預處理與監督式微調(SFT)腳本,開發者可快速使用自訂語料進行模型微調或單獨凍結 Slow/Fast 分支,縮短了從資料準備到模型運行的摸索時間。

Audio8

圖片來源: Audio8

基準評測表現

在標準語音基準測試 Seed-TTS 中,僅有 0.6B 參數的 Audio8 TTS Preview 展現出跨級打擊的實力:

  • 英文詞錯率(EN WER):1.506,超越了 Fish S2 Pro (4.6B, 1.607)、Higgs Audio v2 (4.7B, 1.524) 及 CosyVoice3 (1.5B, 2.22)。
  • 中文字錯率(ZH CER):0.950,在同類小模型中表現頂尖。

常見問答

Audio8_TTS 入門難嗎? 專案提供了 README 操作指引與腳本,不論是透過 audio8_tts_infer.py 進行 CLI 零樣本克隆、部署 ONNX 本地服務,或是透過 SGLang Omni 搭建伺服器,具備程式開發經驗的使用者可根據說明快速完成基礎部署。

它與其他模型的主要差異在哪? 關鍵在於其以僅 0.6B / 0.1B 的微型參數規模,達成了 SOTA 級別的 Zero-Shot 克隆品質;且 0.1B 版本導入了混合架構(Mamba 2 SSM + 注意力)。這讓模型在運算效能上更具優勢,適合硬體條件有限的執行環境。

可以用於商業專案嗎? 可以。專案之程式碼與模型權重均採 Apache License 2.0 開源授權,請詳閱根目錄下的 LICENSE 檔案,確認其條款與署名規範。

結語

Audio8_TTS 解決了部分實作中的效能瓶頸,而非單純追求模型規模。對於計畫開發語音助手或將語音功能整合至現有服務的開發者而言,這是一項值得測試的技術工具。

建議直接前往 GitHub 儲存庫 實際運行一次,這是了解該模型表現最直接的方式。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.