Confucius4-R2T2:為即時語音轉文字設計的穩定輸出模型
即時語音轉文字不只追求辨識率,也要處理延遲、文字反覆修正與下游系統如何接收結果。網易有道推出的 Confucius4-R2T2(全稱 Real Real-Time Transcription)是一款基於 Qwen3-ASR(基座模型 Qwen3-ASR-1.7B,2B 參數)開發的高精度串流語音辨識(ASR)模型,重點放在串流轉錄的穩定性與極低延遲,適合評估即時字幕、會議紀錄、同聲傳譯與 AI 語音代理等工作流。
R2T2 的核心技術與穩定輸出
R2T2 的核心突破在於採用 Append-Only(僅追加) 的輸出模式:已確認發出的文字會永久追加至結果中,不會像傳統偽串流(Pseudo-streaming)模型那樣不斷反覆改寫歷史內容。這種設計可減少即時字幕的畫面閃爍與抖動,也讓下游 LLM 或 Agent 更容易消費穩定的串流文字事件。
在技術實現上,R2T2 結合了多項數據與架構創新:
- 訓練技術:採用穩定前綴資料(Stable-prefix Data)、強制時間對齊資料(Forced Time-alignment Data)與 Token 級別音訊分段。
- 最長穩定前綴(LSP):透過 Longest Stable Prefix 學習範式,模型能動態判斷何時安全發送穩定文字前綴,何時需要等待更多音訊上下文,確保發出文字不回溯。
- 可調解碼 Chunk:支援 80 ms 至 2 s(如常見的 160 ms)的靈活解碼區塊設定,平均延遲維持在 200 ms 至 600 ms,且幾乎不損及離線辨識準確度。
語言支援與部署方式
在語言能力方面,Confucius4-R2T2 針對中文與英文進行了深度優化,同時具備對法語、德語、義大利語、日語、韓語、葡萄牙語、俄語、西班牙語、阿拉伯語等多語言的跨語言串流辨識能力,並原生支援上下文與熱詞提示(Context & Hotword Prompts)。
在服務化與部署選項上,官方提供了多種彈性管道:
- 推論後端:支援高吞吐量的 vLLM 後端,亦可使用 Hugging Face
transformers後端。 - 容器化部署:官方提供預建的 Docker 映像檔(
qwenllm/qwen3-asr),可快速拉起 CUDA 與運行環境。 - WebSocket 服務:專案內建可直接運行的 WebSocket 伺服器(
ws_server.py,預設通訊埠 8272),並支援整合 Stream-VAD(FireRedVAD)模型,方便建立多用戶即時語音串流服務。 - 授權條款:採用雙重授權機制,原始碼採用 Apache License 2.0 開源授權,模型權重則採用 NetEase Model Use License Agreement。
適合的應用與實測建議
Confucius4-R2T2 適合即時字幕直播、會議逐字稿系統、同傳翻譯以及需要穩定事件流的 AI Agent 語音前置模組。導入前建議使用團隊內部的中文、英文、混合語音、專有名詞與多人對話資料進行測試,並分開記錄不同 Chunk 設定下的延遲、WER/CER 表現以及熱詞增強效果。

