tool

Breeze TTS 2 開源登場:即時互動與高擬真語音生成的強大引擎

August 28, 2026
Updated Aug 28
1 min read
Breeze TTS 2 開源登場:即時互動與高擬真語音生成的強大引擎

Breeze TTS 2:語音合成的新選擇

當電腦學會嘆氣或清嗓子,人機對話的感覺就完全不同了。過去的語音合成技術大多語氣平淡,Breeze TTS 2 則試圖改變這一點。這款於 2026 年 8 月 25 日甫釋出的 3B(30億參數)雙語語音合成模型,讓文字轉語音不只是朗讀,還能帶有情緒與生命力。

圖片來源: BreezeBlue/Breeze-TTS-2 · Hugging Face

什麼是 Breeze TTS 2?

這是一個專為即時互動開發的語音合成模型。在 Artificial Analysis 的 TTS 排行榜上,它目前位居開放權重(Open-weight)模型首位,在表現力上已能與不少商業系統抗衡。

除了語音複製,它的語音設計(Voice Design)與語音引導(Voice Direction)能力是開發者的亮點。相較於傳統系統,它具備強大的自然語言指令遵循能力。你可以直接用自然語言引導模型,或在無參考音訊的情況下進行語音設計(例如輸入描述「一位溫柔自信的年輕女性,聲音清晰,語氣親切,表達輕快而富有感染力」),模型就能根據文字描述刻畫出對應的音色與語調。

主要技術特色

1. 內建語音事件 (Vocal Events)

這能有效增加語音的真實感。透過在文本中加入特定標籤,你可以讓合成語音自動加入呼吸、笑聲、咳嗽或清嗓子等聲音,並將這些情緒完美編織進音訊中。 需要特別注意的是,語音事件的標籤語法會因語言而異

  • 英文文本: 使用圓括號 (),例如 (laugh)(cough)(clears throat)(sigh)
  • 中文文本: 使用方括號 [],例如 [笑][咳嗽][清嗓子][嘆氣]

2. 雙語支援與語音設計

該模型同時支援中文與英文。它不需要參考音檔就能生成獨特聲音——只要輸入描述(如「聲音溫暖且自信的女性」),並搭配 --cfg-scale 4 參數來強化模型對指令的遵循度,模型就能完美呈現對應的音色。

3. 低延遲與串流效能

對於即時互動應用,延遲至關重要。根據測試,Breeze TTS 2 在 NVIDIA H100 GPU 上:

  • 超低首字延遲 (TTFA): 在啟用極速預熱路徑下,首字生成延遲可低於 40 毫秒 (ms)。
  • 即時串流 (Streaming): 實時率 (RTF) 達到 0.32,意即能以約 3.1 倍的實時速度快速串流生成音訊(生成 24 kHz 單聲道 16-bit PCM 音訊)。

開發與使用

若手邊有 NVIDIA GPU,安裝過程如下:

  • 需求: Linux 環境、Python 3.10 以上版本,以及支援 CUDA 的 NVIDIA GPU(基本推理約需 7.7 GiB 顯存,啟用極速模式需 14.4 GiB 顯存)。
  • 安裝: 透過 Git 克隆 Breeze TTS 官方程式碼庫 後安裝依賴套件即可:
    git clone https://github.com/breezeblue-ai/breeze-tts.git
    cd breeze-tts
    python -m pip install -r requirements.txt
    
  • 入門(語音複製 Voice Clone): 提供一段乾淨的參考音檔(Reference Audio)及其準確的文字稿(Reference Text),模型即可捕捉該音色的音色、節奏、情緒與語調。

開發者亦可啟動單並行串流 API,並透過 curl 指令發送 API 請求,實現極低延遲的即時語音生成。

常見問題

誰可以使用?(授權條款)

Breeze TTS 2 採取雙重授權機制:

  • 原始碼: 採用寬鬆的 Apache 2.0 授權。
  • 模型權重、檢查點及衍生模型: 採用 BreezeBlue 研究與非商業用途授權 (BreezeBlue Research and Non-Commercial License)。商業應用需另行取得 RESONIA, INC. 的書面授權,可聯繫官方信箱:[[email protected]]。

硬體要求為何?

  • 基本推理模式 (Eager Inference): 約需 7.7 GiB 顯存,建議配備至少 12GB 顯存 的 GPU。
  • 極速編譯模式 (Fast Path): 若要透過 --fast-all 參數啟用全圖編譯與 CUDA Graph 加速以追求極速,顯存約需 14.4 GiB,建議配備 24GB 顯存 的顯示卡(例如 NVIDIA H100 或 A100,預設支援 H100,A100 可在編譯時設定 FLASH_ATTN_CUDA_ARCHS=80)。

法律與社會責任?

使用者必須對生成的內容負責。未經授權的語音複製、身分冒用、詐欺以及其他非法或有害用途均被嚴格禁止。

結語

Breeze TTS 2 讓語音技術在情緒控制上更具彈性,對於開發虛擬助理或遊戲語音的應用場景相當實用。欲進一步測試,可前往 Hugging Face 官方模型頁面 下載體驗。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.