
邊緣運算的視覺語言模型:LFM2.5-VL-3B 實測與應用
Liquid AI 推出的 LFM2.5-VL-3B 是一款專為邊緣裝置設計的視覺語言模型。這款擁有 3.1B(約 31 億)參數的模型在處理文件、螢幕畫面分析、物體定位與工具呼叫等方面,展現出極佳的反應速度與即時性。
圖片來源: LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
詳細發布說明請參閱 Liquid AI 官方部落格文章。
技術架構與創新
LFM2.5-VL-3B 的核心架構是將 SigLIP2 400M NaFlex 視覺編碼器 與 LFM2.5-2.6B 文本模型底座進行深度結合。
在訓練與技術設計上,有以下幾項關鍵突破:
- 適應性解析度編碼: 採用的 SigLIP2 NaFlex(Native Flexible resolution)編碼器原生支援寬高比與解析度的自適應調整,這使模型在進行密集型任務(如 OCR 與精確定位)時能保留更豐富的局部語義特徵與細節。
- 大規模多模態預訓練: 該模型預訓練於高達 34T 的 Token 數據上,並使用了較以往多出 4 倍的精選多模態數據,涵蓋精緻的圖文配對(Image-caption)、OCR 文件、物體定位(Grounding)與多模態指令遵循數據集。
- 原位分詞器擴展(In-place Tokenizer Expansion): 為了在不破壞已有語言表徵的前提下妥善支援非拉丁語系,研發團隊並未重新從頭訓練模型,而是採取「就地擴展分詞器」技術,將詞彙量直接加倍擴展至 128K。
- 先進的後訓練(Post-training)管線: 微調過程分為兩個階段。第一階段為監督微調(SFT),其融合了來自更大規模教師模型的知識蒸餾(Knowledge Distillation)與防崩潰的 Antidoom 訓練;第二階段則採用多獎勵強化學習(Multi-reward RL),全面強化模型的指令遵循與工具呼叫對齊。
其四大核心技術提升包括:
- 螢幕/UI 理解(Screen/UI understanding):對跨設備的數位螢幕與使用者介面內容擁有極強的解析與互動定位能力。
- 物體定位(Grounding):顯著提升了基於自然語言查詢的物體檢測、目標框選與空間定位精度。
- 多圖輸入(Multi-image input):支援同時輸入多張影像,具備強大的跨多圖關聯推理與多輪對話能力。
- 功能呼叫(Function calling):大幅強化了在純文字與多模態場景下的工具呼叫(Function calling)與工作流執行能力。
邊緣部署與實測表現
LFM2.5-VL-3B 在邊緣端運行時的記憶體佔用僅需約 3 GB,非常適合在本地或消費級硬體上部署。其原生支援完整的推論生態系,包含 llama.cpp、MLX、vLLM、SGLang 與 ONNX。
其在不同硬體設備上的實測解碼速度表現非常優異:
- Apple M5 Max:解碼速度達到每秒 228 Tokens。
- AMD Ryzen AI Max+ 395:解碼速度達到每秒 116 Tokens。
- Qualcomm Snapdragon (Galaxy S26 Ultra):每秒可達 20 Tokens,實現完全裝置端(on-device)的流暢多模態推論。
在 GPU 伺服器端部署時,它在多幀輸入下擁有極佳的超低延遲,並在多併發下能達到每秒 11,000 個 Token 的超高輸出吞吐量,效率比 4B 等級的模型高出將近兩倍。

應用場景與核心限制
根據模型特性,開發者在規劃應用時可參考以下建議:
- 適用場景:特別適合需要高吞吐量、低延遲、且需要跨多張影像進行推理與互動的即時任務。例如:即時螢幕 UI 導覽、OCR 文件解析、主動式物體檢測與定位,以及多模態工具呼叫。
- 技術限制(重要):為了確保在邊緣裝置上的即時快速反應,該模型設計為直接回答(Answers directly),而不進行複雜的思維鏈推理(Non-reasoning mode)。因此,它並不適合用於處理需要多步驟深度邏輯推理或需要複雜內部規劃的超長文本任務。
開發與入門指南
1. 環境需求與依賴安裝
除了安裝 PyTorch 與基礎的 Transformers 外,由於這是多模態視覺語言模型(VLM),必須額外安裝 torchvision 與 accelerate 以確保圖像處理與設備自動對齊能正常運作。建議安裝版本如下:
pip install torch torchvision accelerate "transformers>=5.10.1"
2. 模型載入與推理代碼範例
以下是使用 Hugging Face transformers 載入並運行 LFM2.5-VL-3B 的標準程式碼,展示如何利用 AutoModelForImageTextToText 與 AutoProcessor 進行多模態推理:
import torch
from transformers import AutoModelForImageTextToText, AutoProcessor
from transformers.image_utils import load_image
MODEL_ID = "LiquidAI/LFM2.5-VL-3B"
# 載入處理器與模型
processor = AutoProcessor.from_pretrained(MODEL_ID)
model = AutoModelForImageTextToText.from_pretrained(
MODEL_ID,
device_map="auto",
dtype=torch.bfloat16,
)
# 載入測試影像(以雙貓睡在沙發上為例)
img_url = "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/coco_sample.png"
input_image = load_image(img_url)
# 構建多模態對話格式
messages = [
{
"role": "user",
"content": [
{"type": "image", "image": input_image},
{"type": "text", "text": "Describe this image in two concise sentences."},
],
}
]
# 應用對話模板並轉換為模型張量
inputs = processor.apply_chat_template(
messages,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
# 執行推理生成
with torch.inference_mode():
outputs = model.generate(
**inputs,
do_sample=True,
temperature=0.2,
top_k=50,
repetition_penalty=1.0,
max_new_tokens=256,
)
# 解碼輸出結果
output = processor.batch_decode(outputs[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0]
print("模型輸出:", output)
3. 網頁 Demo 體驗與微調
- 網頁 Demo 體驗:官方提供基於 WebGPU 的 LFM2.5-VL-3B 瀏覽器 Demo。用戶可以直接在瀏覽器中利用本地端 GPU 運行此多模態聊天界面,無須任何雲端運算與複雜設定,即可在本地測試多圖互動、OCR 與 Grounding 定位。
- 微調支援:官方在 GitHub 提供了 微調教學指南(Fine-tuning tutorials),開發者可依其指引並搭配 LoRA 等參數高效微調技術,針對特定的視覺定位或工具呼叫任務優化模型表現。



