Bilibili 開源 Index-Translate 翻譯模型家族:支援 150 種語言、長文件與配音音節控制
Bilibili 的 Index LLM 團隊正式開源多語言翻譯模型家族 Index-Translate,採用 Apache-2.0 授權條款釋出模型權重與推論程式碼。該系列以 Qwen3.5 為基礎,除支援 150 種文字語言翻譯,更針對長文件專有名詞一致性、影片配音音節控制,以及具備語音複製能力的語音翻譯,提供專用子模型與自動化配音工具鏈。
隨著大型語言模型在機器翻譯領域的應用逐漸成熟,翻譯任務已從單純的語意轉換,延伸到格式保留、文化用語轉譯、長文脈絡連貫與多模態音訊同步。Bilibili 開發團隊在開發者社群公開了 bilibili/Index-Translate GitHub 專案庫,並在 Hugging Face Index-Translate 模型集合 上線完整的模型權重,同時提供 Index-Translate 線上體驗平台 供外界測試。
團隊成員也在 Reddit LocalLLaMA 討論串 中詳細說明設計理念,說明這套模型如何將傳統文字翻譯延伸至影音製作與長篇內容處理。
Index-Translate 核心文字模型與指令遵循能力
Index-Translate 的核心文字模型目前釋出 2B、9B 以及採混合專家(MoE)架構的 35B-A3B 預覽版(總參數 35B,實際啟用參數約 3B)。模型涵蓋全球 150 種文字語言,在訓練過程中導入多語言指令微調,能依據提示詞指示調整翻譯風格與細節。
格式保留與在地化任務
在軟體在地化或遊戲在地化等實務情境中,翻譯工具常需處理帶有特定標記的結構化內容。根據官方技術文件,Index-Translate 支援保留 JSON 格式結構、變數標籤與預留位置。舉例來說,在韓文翻譯測試中,系統在翻譯公告標題時,能完整保留程式碼標籤與社群標籤(Hashtag),避免格式遭到破壞。
次文化流行語與社群語境翻譯
針對影視與遊戲社群的特殊用語,該系列設計了社群文化用語評測基準 MEME。根據官方公布的測試範例,當輸入遊戲社群用語「狒癮犯了就去打」(指想玩《Final Fantasy XIV》的渴望)時,9B 模型能準確翻譯為「When the FFXIV itch hits, just go play.」,避免字面直譯為猴子成癮等偏離原意的內容。
面向不同工作流程的專用模型
為了解決影音配音、長篇小說閱讀與多模態字幕等複雜需求,團隊針對不同流程發布了三組衍生專用模型。
Index-NativeLong:長篇文件與專有名詞一致性
在長篇翻譯中,同一角色名稱或專有名詞若在前後章節翻譯不一,會大幅影響閱讀體驗。Index-NativeLong(在 Hugging Face 模型庫登記名稱為 Index-Nailong)提供 2B 與 9B 兩種規格,專門針對跨段落上下文進行設計。在官方發布的 32K token 長篇奇幻小說對比測試中,相較於切分段落翻譯容易將特定人名誤翻為頭銜的情況,Index-NativeLong 能夠在全文多個段落中保持專有名詞的譯名統一。
Index-Homura:依音節預算調整譯文長度
影音翻譯在進入配音階段時,常會遇到譯文發音長度與原影片口型不符的問題。Index-Homura 引入「音節預算」(Syllable Budget)控制機制,這項技術源自研究團隊發表於 EMNLP 2026 會議的學術論文。使用者在給予提示詞時可以指定目標音節數量,例如設定為 10、14 或 18 個音節,模型會自動挑選合適的詞彙結構輸出對應長度的譯文,配合配音的時間限制。不過開發團隊也在社群討論中提醒,雖然該模型能配合音節預算,但若要直接應用於可唱性歌詞翻譯,仍牽涉到節奏與押韻等音樂結構,目前尚未列為正式保證功能。
Index-Echo:語音轉字幕與聲音複製配音
Index-Echo 專注於音訊處理,分為兩大模組:
- 語音轉字幕(S2TT):Index-Echo-S2TT 能直接將語音轉換為附帶句子級時間標記的雙語 .srt 字幕檔。根據官方評測,在不使用外部對齊工具的情況下,其起始時間平均絕對誤差(MAE)約為 0.4 秒。
- 語音轉語音翻譯(S2ST):Index-Echo-S2ST 整合端到端語音翻譯與音色複製能力,在將說話者語音翻譯為目標語言時,以原始語音的音色作為參考進行語音合成。
部署需求與開源應用工具鏈
Index-Translate 全系列程式碼與已釋出的模型權重均遵循 Apache-2.0 開源授權條款。
在推論部署方面,文字模型可透過支援 Qwen3.5 架構的 vLLM 引擎啟動服務,提供與標準 OpenAI 規範相容的 API 介面,方便開發者串接既有工作流程。此外,官方專案庫也隨附了兩項實用工具:
- 瀏覽器擴充功能:支援 Chrome、Edge 與 Firefox,能直接呼叫本機部署的模型對網頁文字進行即時翻譯。
- 影片自動配音流程:包含音訊提取、人聲分離、語音分段、翻譯配音與音畫對齊的完整自動化流程。
常見問題
Index-Translate 支援多少種語言?
文字翻譯模型(Index-Translate)涵蓋 150 種文字語言。不過需要注意,負責語音轉字幕與語音轉語音的 Index-Echo 系列,目前僅支援中文、英文、日文、西班牙文等特定語言方向,尚未涵蓋全部 150 種語言。
Index-NativeLong 與一般分段翻譯有何不同?
一般長文件翻譯通常將文章拆分為固定長度的段落分別處理,容易導致同一專有名詞在不同段落出現不同譯名。Index-NativeLong 具備長文本上下文處理機制,能在更長的上下文視窗中參照前後文,降低人名與術語前後矛盾的情況。
Index-Echo 在本機執行需要額外的對齊工具嗎?
根據官方技術報告,Index-Echo-S2TT 本身即可直接輸出帶有時間標記的雙語 .srt 字幕,實測時間標記誤差約在 0.4 秒左右,一般使用情境下無需另外配置強制對齊工具。
結語
Bilibili 推出的 Index-Translate 家族呈現了機器翻譯模型向專業化與影音工作流程延伸的趨勢。透過將基礎文字翻譯、長文術語一致性、音節長度控制與語音生成各自模組化,開發者能夠依據本機硬體規格挑選合適的子模型。目前 35B-A3B 模型仍屬於預覽版本,官方團隊表示未來將持續釋出正式版本、擴充 Index-Echo 的支援語系,並逐步開源 instTrans 與 SandGlass-V2 等測試基準資料集。

