Jina OCR v1:把文件轉成可用的 Markdown
將 PDF、掃描檔或複雜版面交給 OCR,真正困難的往往不只是辨識文字,還包括表格、公式、段落與閱讀順序。Jina AI 開源的 Jina OCR v1 是一款端到端(Page-to-Markdown)的文件解析模型,旨在兼顧高品質輸出與高效推論,直接將文件頁面轉化為結構化的 Markdown。
模型架構與技術重點
Jina OCR v1 採用輕量化與混合專家(MoE)架構設計:
- 模型規模:總參數量為 3.4B,但前向傳播每個 Token 僅需激活約 570M 活躍參數,兼具小模型的推論成本與大模型的容量。
- 視覺與解碼器架構:繼承 DeepSeek-OCR 架構,包含約 380M 參數的 DeepEncoder(將 1024×1024 圖像壓縮為 256 個視覺 Tokens),以及 12 層的 DeepSeek-3B-MoE 解碼器(64 個 Routed Experts 與 2 個 Shared Experts,Top-6 路由)。
- FastMTP 投機解碼(Speculative Decoding):透過遞迴共享單一密集草稿模組(K=3),並結合貪婪驗證(Greedy Verification),實現無損(Lossless)的解碼加速,產出與傳統自回歸完全一致的文字。
- 多語言與頁面處理:預訓練語料覆蓋約 100 種語言(支援多達 108 種語言);預設會過濾重複的頁首與頁尾(Headers/Footers),並自動將公式轉為 LaTeX(
$/$$)、表格轉為 HTML<table>格式。
評測表現與速度(標示測試條件)
在官方報告的實測基準中,Jina OCR v1 展現出極高的推論吞吐量:
- OmniDocBench v1.6 評測:整體得分 91.14(公式 CDM 達 93.28、表格 TEDS 達 84.68)。
- olmOCR-Bench 評測:整體得分 83.4(Base 基礎文本達 99.9、表格 88.8、多欄排版 85.5;但在嚴重損毀的舊掃描檔 OldScans 僅 42.6,建議難度極高的歷史檔案仍需人工覆核)。
- 吞吐量與速度測試:在單張 NVIDIA A100 (SXM4 40GB, 併發 32) 條件下,達到 2.57 pages/s 的吞吐量(平均每頁產生 1,085 Token);在單張 NVIDIA L4 (Batch Size 1) 環境下,開啟 FastMTP (K=3) 可將解碼速度從 42.7 提升至 83.1 tokens/s(約 1.95 倍加速)。
如何開始與部署選項
使用者可根據需求選擇雲端服務或地端部署:
- 本地與服務化部署:支援 Hugging Face
transformers(使用AutoModelForCausalLM/AutoProcessor需設定trust_remote_code=True)、vLLM(註冊deepseek_ocr_mtp.py啟用 FastMTP 加速,設定num_speculative_tokens=3)、SGLang,或透過 Docker(docker model run hf.co/jinaai/jina-ocr-v1)運行。 - 雲端 API 與工具:可使用 Jina Reader(
r.jina.ai帶入 HeaderX-Respond-With: jina-ocr-v1)、OpenAI 相容的託管 API(api.jina.ai/v1/chat/completions)或官方 Playground 介面。 - 開源授權:採用 CC BY-NC 4.0 非商業授權(商業使用需向 Jina AI 申請授權)。
適合的工作流
Jina OCR v1 適合大批量文件匯入、PDF 轉 Markdown 管道、知識庫(RAG)前處理與歷史文檔數位化。由於其具備結構化 Markdown 輸出能力,能有效簡化後續的資料解析流程。

