TOOL FIELD NOTE

網易有道開源 Confucius4-R2T2:極低延遲、高精度的實時語音轉文字模型

Confucius4-R2T2:為即時語音轉文字設計的穩定輸出模型 即時語音轉文字不只追求辨識率,也要處理延遲、文字反覆修正與下游系統如何接收結果。網易有道推出的 Confucius4-R2T2(全稱 Real Real-Time Transcription)是一款基於 Qwen3-ASR(基座模型 Qwen3-ASR-1.7B,2B 參數)開發的高精度串流語音辨識(ASR)模型,重點放在串流轉錄的穩定性與極低延遲,適合評估即時字幕、會議紀錄、同聲傳譯與 AI 語音代理等工作流。 R2T2 …

PUBLISHED 2026.09.25
READING TIME 1 MIN
UPDATED 2026.09.25
01

COMMUNEIFY
EDITORIAL

把複雜的技術,整理成值得慢慢讀完的內容。

Confucius4-R2T2:為即時語音轉文字設計的穩定輸出模型

即時語音轉文字不只追求辨識率,也要處理延遲、文字反覆修正與下游系統如何接收結果。網易有道推出的 Confucius4-R2T2(全稱 Real Real-Time Transcription)是一款基於 Qwen3-ASR(基座模型 Qwen3-ASR-1.7B,2B 參數)開發的高精度串流語音辨識(ASR)模型,重點放在串流轉錄的穩定性與極低延遲,適合評估即時字幕、會議紀錄、同聲傳譯與 AI 語音代理等工作流。

R2T2 的核心技術與穩定輸出

R2T2 的核心突破在於採用 Append-Only(僅追加) 的輸出模式:已確認發出的文字會永久追加至結果中,不會像傳統偽串流(Pseudo-streaming)模型那樣不斷反覆改寫歷史內容。這種設計可減少即時字幕的畫面閃爍與抖動,也讓下游 LLM 或 Agent 更容易消費穩定的串流文字事件。

在技術實現上,R2T2 結合了多項數據與架構創新:

  • 訓練技術:採用穩定前綴資料(Stable-prefix Data)、強制時間對齊資料(Forced Time-alignment Data)與 Token 級別音訊分段。
  • 最長穩定前綴(LSP):透過 Longest Stable Prefix 學習範式,模型能動態判斷何時安全發送穩定文字前綴,何時需要等待更多音訊上下文,確保發出文字不回溯。
  • 可調解碼 Chunk:支援 80 ms 至 2 s(如常見的 160 ms)的靈活解碼區塊設定,平均延遲維持在 200 ms 至 600 ms,且幾乎不損及離線辨識準確度。

語言支援與部署方式

在語言能力方面,Confucius4-R2T2 針對中文與英文進行了深度優化,同時具備對法語、德語、義大利語、日語、韓語、葡萄牙語、俄語、西班牙語、阿拉伯語等多語言的跨語言串流辨識能力,並原生支援上下文與熱詞提示(Context & Hotword Prompts)。

在服務化與部署選項上,官方提供了多種彈性管道:

  • 推論後端:支援高吞吐量的 vLLM 後端,亦可使用 Hugging Face transformers 後端。
  • 容器化部署:官方提供預建的 Docker 映像檔(qwenllm/qwen3-asr),可快速拉起 CUDA 與運行環境。
  • WebSocket 服務:專案內建可直接運行的 WebSocket 伺服器(ws_server.py,預設通訊埠 8272),並支援整合 Stream-VAD(FireRedVAD)模型,方便建立多用戶即時語音串流服務。
  • 授權條款:採用雙重授權機制,原始碼採用 Apache License 2.0 開源授權,模型權重則採用 NetEase Model Use License Agreement。

適合的應用與實測建議

Confucius4-R2T2 適合即時字幕直播、會議逐字稿系統、同傳翻譯以及需要穩定事件流的 AI Agent 語音前置模組。導入前建議使用團隊內部的中文、英文、混合語音、專有名詞與多人對話資料進行測試,並分開記錄不同 Chunk 設定下的延遲、WER/CER 表現以及熱詞增強效果。

相關連結

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.