
輕量級視覺模型:North Micro Vision
在人工智慧領域,我們習慣追求千億參數的巨型模型,但輕量化工具往往才是開發者的實際選擇。Cohere 近期發布了 North-Micro-Vision-Instruct,這是一個參數規模僅 2.4B 的開源輕量級視覺語言模型 (VLM)。該模型採用 Apache 2.0 授權,因為體積輕巧,能直接在筆記型電腦、行動端或邊緣裝置上運行,無須仰賴昂貴的雲端運算。
圖片來源: Meet North Micro Vision: A 2.4B Native-Resolution Vision-Language Model
為什麼選擇小模型?
這裡的核心優勢是「原生解析度」的支援。傳統模型為了處理影像,常將輸入強制壓縮或裁切為正方形縮圖,這會導致文件、表格、圖表或網頁截圖中的微小細節流失。
North Micro Vision 支援原生解析度輸入,能完整保留原始影像的長寬比與精細結構。無論是掃描文件、網頁截圖、複雜表格或圖表,它都能精確解析微小的文字資訊與空間定位,這使其在文件理解(Document AI)與視覺問答(VQA)任務中表現極為突出。
架構設計
模型由三個核心部分組成:
- 400M 參數的視覺編碼器:基於 SigLIP 2 SO400M 優化。開發團隊導入「連續旋轉位置編碼(C-RoPE,結合 2D RoPE 與雙線性插值的 1D 位置編碼)」技術,讓模型能靈活應對各種長寬比與原生解析度的輸入。
- 連接層(Projector):將視覺特徵映射到語言模型的嵌入空間。遵循 DeepStack 架構,將視覺編碼器多個層級的特徵(Patch Embeddings)注入語言模型的早期層級,使語言模型能同時獲取不同抽象程度的視覺表徵。
- 2B 參數的語言模型(North Micro LLM):採用 Command A+ 架構。該架構交替使用三個具有旋轉位置嵌入的滑動窗口注意力層(Sliding-window Attention)與一個無位置嵌入的全域注意力層(Global Attention)。
訓練流程
模型經歷了四個嚴謹的訓練階段,其中第二階段拆分為兩個解析度升級期:
- Stage 1 — 視覺編碼器與連接層預訓練(10M 樣本):在固定解析度 384 × 384 像素下進行。此階段保持語言模型(LLM)凍結,僅訓練視覺編碼器與 Projector,數據混合比例為 60% 密集描述(Dense Captions)與 40% OCR 數據。
- Stage 2 — 漸進式解析度提升聯合訓練:
- Stage 2.1(13M 樣本):解析度提升至 1024 × 1024 像素。此時解除語言模型凍結,將視覺編碼器、連接層與語言模型進行全模型聯合訓練(Joint Training)。數據混合比例為 50% 密集描述與 50% OCR。
- Stage 2.2(10M 樣本):解析度上限進一步提升至 1654 × 2339 像素(對應 A4 紙張在 200 dpi 下的解析度)。此階段繼續進行全模型聯合訓練,使模型能完整保留並適應 A4 單頁文檔的長寬比。
- Stage 3 — 多模態指令微調(50M 樣本):在原生解析度下進行全模型聯合訓練。訓練集涵蓋了 OCR、圖表分析、空間定位/計數、一般視覺問答(VQA)以及部分純文字數據(以維持語言基礎能力),大幅提升了模型在細節保留與指任意圖遵循上的表現。
- Stage 4 — 偏好調整(500k 樣本):採用簡化版的「混合偏好最佳化 (MPO)」技術。此階段將視覺編碼器與連接層凍結,僅微調語言模型。該算法移除了 BCO 損失,結合了 DPO 偏好損失與 15% 權重的輔助次標記預測/SFT 損失,以顯著提升模型的安全防護、格式化輸出與對話回應品質。
如何使用
目前可透過 Hugging Face 的 Transformers 函式庫執行:
- 環境:需安裝 PyTorch 及最新版本 Transformers。若有 NVIDIA GPU,建議啟用 Flash Attention 2 以獲得加速效能。
- 載入:使用
AutoModelForImageTextToText載入模型權重。 - 執行:透過
processor.apply_chat_template處理提示詞與影像,即可返回結果。
官方推薦的 API 呼叫/推理參數配置為:
- Temperature (溫度):
0.7 - Top_p:
0.8 - Top_k:
20 - Min_p:
0.0 - Presence Penalty (存在懲罰):
1.5 - Repetition Penalty (重複懲罰):
1.0 - 最大生成 Token 限制:針對非推理型任務,建議將生成限制設為
1024。
常見問題
Q:適合哪些應用場景? A:非常適合特定任務的微調與部署,例如:企業收據/發票/表單資訊擷取、網頁截圖與 UI 排版分析、多語言視覺問答,以及資源受限的邊緣設備或筆記型電腦端部署。
Q:對硬體有什麼限制? A:2.4B 的參數規模對現代筆記型電腦和邊緣設備而言負擔極低。不過需要注意,輸入高解析度的影像會增加編碼時的記憶體消耗,建議根據圖片實際解析度與裝置記憶體限制進行動態配置。
Q:支援微調與生態工具嗎? A:可以。Cohere 與 NVIDIA 深度合作,官方推出了 NVIDIA AutoModel 部署與微調食譜(recipe),可直接在 NVIDIA GPU 上進行開箱即用的微調與部署。此外,模型也獲得了社群 Axolotl 微調框架 的原生支援,以及 MLX-VLM 格式 的 Apple Silicon 本地端推論支援。
North Micro Vision 指明了輕量化視覺大模型在保留原生比例與精細度上的新方向。若你需要一個能精準解析文件、無需雲端伺服器且能「輕裝上陣」的視覺語言模型,這無疑是一個最值得評估的開源首選。

圖片來源: CohereLabs Huggingface



