騰訊開源 5B 全模態解析模型 Youtu-Parsing-Omni:統一架構處理文件、圖表、音訊與影片
騰訊優圖實驗室發布 50 億參數規模的全模態結構化解析模型 Youtu-Parsing-Omni,主打單一編碼器與統一 OmniSchema JSON 輸出格式。模型能直接解析一般文件、複雜圖表、幾何圖形、音訊以及視訊內容,並同步完成感知標註與語意摘要。本文整理該模型的技術架構、官方評測數據、部署注意事項與授權限制。
企業在建立知識庫或檢索增強生成(RAG)系統時,經常面臨跨模態資料格式不一致的困境。一份專案資料可能同時包含掃描合約、會議錄音、簡報投影片與產品展示影片,以往需要分別呼叫光學字元辨識、圖表分析與語音轉文字等多套專用工具,再由工程團隊手動拼接輸出欄位。針對這類繁瑣的資料前處理流程,騰訊優圖實驗室推出了 5B 規模的開源權重模型 Youtu-Parsing-Omni,嘗試以單一模型處理多種媒體格式,並將結果輸出為標準化的 JSON 資料。
什麼是 Youtu-Parsing-Omni
Youtu-Parsing-Omni 是騰訊優圖實驗室推出的輕量級全模態解析模型,參數量約為 53 億(5.33B BF16)。根據開發團隊在 Hugging Face 專案頁面 與 GitHub 技術報告路徑 所公布的資訊,該模型能接收文件頁面、照片、統計圖表、流程圖、幾何圖案、音訊檔案以及影片,並針對不同任務輸出統一格式的 JSON 結果。
傳統的多模態解析工具通常只輸出 Markdown 文字,但 Youtu-Parsing-Omni 將解析目標擴展為感知(Perception)與認知(Cognition)兩層結構。在感知層面,模型會偵測版面元素的位置座標(Bounding Box)、識別文字內容、轉換數學公式為 LaTeX、將表格轉為 Markdown 或 OTSL,並標記語音說話者與時間戳。在認知層面,模型則會根據整體輸入產出全域摘要、說明文字或結構化分析報告。
模型依據任務提示詞(Task Prompt)切換解析模式,涵蓋以下七大解析家族:
- 文件頁面(document):解析文字段落、表格、公式、流程圖與閱讀順序。
- 自然圖像(natural_image):標記實體邊界框、物件標籤、局部描述與全域場景說明。
- 統計圖表(graphics_chart):將長條圖、折線圖或圓餅圖還原為 Markdown 表格與文字說明。
- 流程圖(graphics_flowchart):將圖形關係轉譯為 Mermaid 流程圖語法。
- 幾何圖形(graphics_geometric):識別幾何點、線段、圓弧與尺寸標註數據。
- 音訊片段(audio):區分語音與非語音區間,輸出時間戳、說話者標籤、語音轉文字(ASR)與聲學事件描述。
- 視訊內容(natural_video 與 textrich_video):針對自然影片記錄動作、鏡頭移動與聲音事件,針對演講或教學影片則同步進行畫面 OCR 與語音辨識,產生整段影片的結構化總結報告。
單一編碼器與感知層音視頻融合機制
多數現行的全模態系統習慣採用雙塔架構,也就是影像與聲音分別透過兩個各自預訓練的模型進行編碼,直到進入大型語言模型(LLM)解碼器時才進行特徵交會。Youtu-Parsing-Omni 則選擇不同的技術路線。
共享權重的 Youtu-Omni-Encoder
研發團隊設計了 Youtu-Omni-Encoder,以文字語言模型作為權重初始化的基礎,以此強化模型對符號與排版結構的先驗理解能力。輸入端透過輕量化的模態專用通道(Stem),將影像像素轉換為視覺 token,同時將音訊的 log-mel 頻譜圖轉為音訊 token。
進入核心的雙向 Transformer 時,所有模態的特徵都會被放入同一個張量中進行計算。由於影像、音訊與影片共用絕大部分編碼器參數,模型在感知階段就能直接對不同訊號建立關聯,減少雙塔架構在特徵轉換時產生的資訊耗損。
時序座標對齊與感知層內部融合
在處理影片輸入時,視訊影格與音訊切片會依照時間順序交錯排列。Youtu-Parsing-Omni 採用統一的三維座標系統 (t, h, w) 進行位置編碼。
視覺 token 的時間維度 t 來自影格索引,高度與寬度 (h, w) 則對應影像網格。音訊 token 的時間維度 t 對應時間偏移量,高度與寬度則設為零。在編碼器的融合層中,注意力機制會在音訊與影像的邊界重新建立視窗,讓特定影格可以直接與當前時間點的聲音訊號互相計算注意力。跨模態對齊工作在編碼器內部就已完成,而非交由後端解碼器勉強推測。
統一資料規範:OmniSchema 與自進化蒸餾技術
為了讓解析結果能夠直接介接下游應用程式,Youtu-Parsing-Omni 規範了標準的 OmniSchema JSON 格式。所有座標均使用 0 到 1000 的整數網格表示,時間則統一使用標準時間戳記。
由於不同任務共用相同的資料結構,團隊在監督微調(SFT)與增強學習之後,採用了名為 OmniSchema-Aware On-Policy Distillation(OSAD)的自進化蒸餾演算法。
在 OSAD 訓練流程中,學生模型會自行產生解析樣本。通過 JSON 格式驗證、架構符合度與重複性檢查的樣本,會交由一個看過標準答案的凍結教師模型進行打分。訓練目標會依據 token 的角色進行動態區分:
- 內容類 token(如文字內容、數值)使用 Jensen–Shannon 散度進行評估。
- 結構類 token(如 JSON 鍵名、標籤語法)則使用較高溫度的向前 KL 散度進行約束。
每個訓練回合結束時,學生模型的 LoRA 適應層會被合併至本體,並晉升為下一回合的教師模型。這種機制讓模型在維持格式穩定度的同時,逐步校正解析細節。
官方評測表現:OmniDocBench 與 OmniParsingBench 數據分析
根據騰訊在 Hugging Face 模型說明頁 提供的數據,Youtu-Parsing-Omni 在數項標準測試中取得了不錯的成績,但各項任務之間仍有明顯的特徵差異。
文件解析領域的基準測試數據
在評估頁面解析能力的 OmniDocBench v1.6 測試中,官方公布的綜合評分如下:
- Youtu-Parsing-Omni(5.0B):綜合評分 96.96,文字編輯距離 0.0271,閱讀順序編輯距離 0.1104。
- TeleOCR(1.2B):綜合評分 96.91,文字編輯距離 0.0267,閱讀順序編輯距離 0.1184。
- OvisOCR2(0.8B):綜合評分 96.47。
- PaddleOCR-VL-1.6(0.9B):綜合評分 96.34,公式 CDM 分數 97.53。
- MinerU2.5-Pro(1.2B):綜合評分 95.75。
- Gemini-3-Pro:綜合評分 92.91。
- GPT-5.2:綜合評分 86.59。
從數據可以看出,Youtu-Parsing-Omni 在該項榜單中位居前列,特別是在純結構表格分數(TEDS-S 達 98.20)與閱讀順序還原上表現較佳。不過,它與第二名 TeleOCR 的差距僅有 0.05 分,且 TeleOCR 在純文字編輯距離上略微勝出,而 PaddleOCR-VL-1.6 在數學公式辨識(97.53 對比 96.80)也保持領先。考慮到 Youtu-Parsing-Omni 的參數量約為這些專用模型的四到五倍,其優勢在於整合性而非單項指標的絕對輾壓。
跨模態與專業領域解析能力
在綜合評估各類媒體的 OmniParsingBench 測試中,Youtu-Parsing-Omni 取得了 75.08 的平均分數,在開源權重模型中排名第一,僅次於商用閉源模型 Gemini-3-Pro 的 77.44 分。
細看各項子分數,Youtu-Parsing-Omni 在統計圖表解析(95.02 對比 92.79)與純音訊任務(78.08 對比 76.74)高於 Gemini-3-Pro。然而在幾何圖形(74.33 對比 85.43)與自然圖像理解(62.84 對比 69.73)上,該模型與頂級多模態大模型之間仍有可觀察到的落差。
此外,官方也公布了符號識別的測試結果:在 ChemOCR 化學結構式辨識中,嚴格 Tanimoto 指標達到 54.2%;在 PDMX-Synth 全頁五線譜辨識中,字元錯誤率(CER)為 22.73%,接近專用音樂辨識模型 LEGATO 的 23.30%。這顯示出模型在特殊符號領域具備一定的通用能力。
開發者部署流程與環境注意事項
有意測試該模型的開發者,可以在 GitHub 原始碼庫 取得推論腳本與外掛程式。在環境設定上,有幾個技術細節需要特別留意。
官方提供兩種安裝管道,兩者不可混用在同一個 Python 環境內:
- vLLM 服務端:需搭配 vllm-plugin-vita-omni 外掛,指定安裝
transformers==5.2.0,且必須手動移除peft套件。 - 原生 Transformers 推論:需在獨立環境安裝
transformers==5.10.2。
啟動 vLLM 服務時,指令會預設綁定最大上下文長度 65536,單卡推論需配置足夠的顯示卡記憶體(模型權重檔案約 10.7 GB,建議預留充足空間給多模態 token 快取)。推論呼叫時,系統需設定自訂參數 chat_template_kwargs={"enable_thinking": False, "enable_parsing": True},並且停用特殊 token 過濾,因為邊界框座標直接包含在特殊 token 之中。
除了技術配置外,授權條款也是企業必須評估的一環。Youtu-Parsing-Omni 採用自訂的 youtu-parsing 授權協議,條款開頭明確註記該模型不適用於歐盟境內(not intended for use within the European Union)。如果企業業務範圍涵蓋歐盟市場,在導入前應由法務團隊審核授權風險。
常見問題
Youtu-Parsing-Omni 是否能完全取代專用的 OCR 或語音辨識模型?
這取決於實際的業務情境。如果系統只需要處理大量標準掃描文件,體積在 1B 左右的專用 OCR 模型(如 TeleOCR 或 PaddleOCR)運算成本更低,在純文字與公式上的表現也相當接近。Youtu-Parsing-Omni 的價值在於工作流程中同時包含圖表、影片、錄音與簡報時,可以用單一服務端點產出標準 JSON,減少維護多套模型與轉換資料規格的工程成本。
部署該模型需要哪些硬體規格與軟體環境?
運行該模型需要支援 CUDA 的 GPU 環境以及 Python 3.10 以上版本。模型權重以 BF16 格式儲存約佔 10.7 GB,考慮到視訊影格與音訊切片會消耗大量 token 預算,建議使用 24GB 以上顯示卡記憶體的伺服器級 GPU。若需處理多媒體檔案,系統底層亦需預先安裝 ffmpeg 工具。
企業在商業專案中使用這款模型有哪些授權限制?
該模型並非採用寬鬆的 MIT 或 Apache-2.0 授權,而是使用騰訊自訂的 youtu-parsing 條款。其中包含明確的地域限制宣告,指出該模型不適合在歐盟境內使用。企業在將其整合進海外或跨國產品前,需詳細確認該項合約限制。
結語
Youtu-Parsing-Omni 展示了將文件分析、視覺偵測與語音辨識整合進單一 5B 模型的可行性。其優勢在於統一的 OmniSchema JSON 輸出與感知層融合架構,能大幅簡化多模態檢索系統的資料清洗流程。對於需要跨媒體解析的開發團隊而言,這是一個值得在自身資料集上進行實測的開源選項,但正式導入前仍需權衡硬體資源消耗與特定的授權規範。

