開源視覺文件解析新選擇:LightOnOCR-3-4B 架構特點與應用解析
法國人工智慧團隊 LightOn 正式開源 LightOnOCR-3-4B 模型,採用 Qwen3.5 視覺語言架構與 Apache 2.0 授權,提供整頁文字轉錄與精準視覺定位雙模式,能直接將複雜文件轉換為結構化 Markdown、圖表資料與座標標籤,有效降低企業打造文件處理流程的維護成本。
傳統光學字元辨識工具在處理包含多欄排版、複雜表格、手寫註記與統計圖表的文件時,往往需要串接多個獨立模型與啟發式規則。這種多階段管線除了提高部署與除錯難度,不同模組之間的誤差也容易累積放大。針對這項實務瓶頸,LightOn 推出了第三代開源光學字元辨識模型系列,其中最大規格的 LightOnOCR-3-4B 結合了文字轉錄與版面理解能力,提供開發者更簡潔的端到端解決方案。
LightOnOCR-3 系列規格與核心設計
LightOnOCR-3 全系列均以開源形式釋出,涵蓋三種不同參數量級,方便開發者依據運算資源與辨識精度需求進行選型。
在模型架構方面,0.8B 與 4B 版本改採 Qwen3.5 視覺語言架構,相較於前代架構能更有效整合現有的推論引擎生態。1B 版本則保留 LightOnOCR-2 的專屬模型結構,適合希望直接平滑升級現有系統的使用者。全系列皆採用寬鬆的 Apache 2.0 開源授權,允許學術研究與商業系統自由使用。
| 模型版本 | 參數規模 | 架構特點 | 適用情境 |
|---|---|---|---|
| LightOnOCR-3-4B | 4.0B | Qwen3.5 視覺語言架構 | 系列中辨識精度最高,適合各類複雜排版與圖表解析 |
| LightOnOCR-3-0.8B | 0.8B | Qwen3.5 視覺語言架構 | 運算資源受限但要求高處理效率的邊緣或高通量環境 |
| LightOnOCR-3-1B | 1.0B | LightOnOCR-2 專屬架構 | 現有 LightOnOCR-2 部署架構的直接升級替代方案 |
轉錄與定位雙模式:彈性應對不同下游需求
LightOnOCR-3-4B 透過簡單的文字提示詞即可切換輸出型態,大幅簡化系統整合門檻。
純文字轉錄模式
當提示詞設定為空字串時,模型將自動進入標準轉錄模式。此時模型會依照閱讀邏輯順序,將整頁文件的文字、標題、清單與表格轉換為標準 Markdown 格式。若原有系統已經整合前代模型,此模式的輸入與輸出介面完全一致,不需改動任何現有程式碼。
視覺定位與資料結構化模式
若將提示詞指定為 grounding,模型會切換至結構化定位模式。輸出內容會在每個資訊區塊前方附帶正規化至 0 到 1000 的邊界框座標與語意標籤,例如本文、標題、清單、頁首、頁尾、表格、公式與圖表。
更重要的是,定位模式不只標記視覺物件位置,還會針對圖像產生文字描述,並將統計圖表轉譯為標準 HTML 表格數值。這種輸出格式直接把非結構化圖表轉換為可供檢索系統使用的結構化資料,省去額外撰寫圖表解析模組的負擔。
[80,70,920,140] # 2025 年度財務報告
[80,175,920,225] 營收年增率達到百分之二十。
[80,285,460,545] 太陽能發電廠外觀空拍圖。
[540,285,920,545] <table><tr><th>年度</th><th>營收</th></tr><tr><td>2024</td><td>1000萬歐元</td></tr><tr><td>2025</td><td>1200萬歐元</td></tr></table>
相較於常見的 JSON 巢狀結構,LightOn 採用緊湊的內嵌標記語法。根據官方測試統計,在 512 頁 olmOCR-bench 樣本上,LightOnOCR-3-4B 在定位模式下產生的輸出 Token 總數,比起 Chandra-OCR-2 與 Infinity-Parser2-Pro 減少約百分之九至百分之十四,能有效減少解碼運算負荷並提升生成效率。
基準測試與辨識效能表現
根據 LightOn 官方技術發布報告 所揭露的多項標準基準測試數據,LightOnOCR-3-4B 在同級參數量模型中展現了穩健的辨識水準。
olmOCR-Bench 綜合評測
在檢驗學術論文與複雜文件的 olmOCR-Bench 評測中,LightOnOCR-3-4B 取得 86.3 分的綜合表現,優於同為 4B 規模的 Chandra 2(85.8 分),並且緊咬參數規模達 35.1B 的 Infinity Parser Pro(87.6 分)。在 ArXiv 學術論文分類項目中,4B 版本更拿下 91.1 分的高分,表現相當突出。
ParseBench 圖表與結構化測試
ParseBench 主要測試模型對圖表、表格以及版面邏輯的理解程度。LightOnOCR-3-4B 在五項指標綜合得分為 75.1 分,在參評開源模型中名列前茅。其中圖表資料萃取獲得 66.1 分,語意排版獲得 67.6 分,反映出以預訓練視覺語言模型作為骨幹架構時,對圖形資訊的解析優勢。
法文與特殊版面評測(fr-bench-pdf2md)
在涵蓋手寫字、多欄混排與表單文件的 fr-bench-pdf2md 測試中,LightOnOCR-3-4B 取得 74.1 分的整體成績。其中手寫文件辨識得分 46.1 分,表單辨識 49.6 分,多欄版面則達到 83.6 分,展現對非標準排版文件的適應能力。
訓練策略與多階段資料管線
LightOnOCR-3 之所以具備直接輸出座標與結構化資料的能力,仰賴其資料合成與強化學習設計。
在監督微調階段,團隊調高了困難樣本的抽樣權重,數學公式與表格資料的抽樣比重分別提高為 2 倍與 3 倍。此外,開發團隊利用合成資料工具 DocDuck 產出大量包含密集小字、特殊符號與超過二十種語言的多樣化版面,並搭配 Muon 優化器與序列打包技術提高訓練效率。
在監督微調完成後,研發團隊引入基於可驗證回饋(Verifiable Rewards)的強化學習(GRPO 演算法)。回饋機制針對預測座標框與標註框的交併比(IoU)、標籤一致性,以及合成頁面的語法正確性進行評分。這種訓練方式促使模型在維持文字轉錄正確率的同時,逐步提高空間幾何座標的穩定度。
部署與推論使用指南
LightOnOCR-3-4B 支援主流開源推論生態系,開發者可選擇原生 Transformers 函式庫或高通量推論引擎 vLLM 進行本地化部署。
影像前處理與渲染建議
官方在技術文件中建議,將 PDF 文件轉為圖片時,推薦以 400 DPI 進行光柵化,並將最長邊等比例縮放至 2048 像素以內。維持原本的長寬比有助於模型準確判斷排版幾何特徵。如果追求更高處理輸送量,將最長邊調降至 1540 像素可大幅減少視覺 Token 數量,但對小字與密集圖表的辨識率可能略有影響。
vLLM 服務端啟動設定
使用 vLLM 架設高並發 API 服務時,可透過以下指令啟動服務端點,官方建議在設定中預設關閉思考模板:
vllm serve lightonai/LightOnOCR-3-4B \
--trust-remote-code \
--default-chat-template-kwargs '{"enable_thinking": false}'
完成服務啟動後,客戶端即可透過標準 OpenAI 相容介面傳送 Base64 編碼圖片與提示詞,快速取得結構化辨識成果。
常見問題
LightOnOCR-3-4B 是否需要搭配傳統版面偵測模型?
不需要。模型原生整合了文字辨識、版面分割、邊界框標記與圖表數值轉換功能,單一模型即可完成傳統流程中需要多個模組才能實現的任務。
模型是否支援繁體中文等非英語系文件?
支援。訓練資料集中納入了超過二十種語言的多語言排版樣本,在常見的多語言商業合約、發票與學術文獻均能執行文字辨識與結構化轉錄。
商業專案是否可以免費使用該模型?
可以。該模型採用 Apache 2.0 授權條款,允許個人、學術機構及企業在符合規範的前提下免費進行商業化部署、修改與整合。
結語
LightOnOCR-3-4B 透過將視覺定位與文字轉錄整合進 4B 參數量級的視覺語言架構中,為文件理解應用提供了一套輕量且功能完整的開源方案。有興趣評估效能的開發者,可以直接前往 Hugging Face 官方模型頁面 查閱權重檔案,或至官方展示空間進行線上頁面測試。

