
LFM2.5-2.6B:讓 AI 代理在裝置端運作
Liquid AI 推出的 LFM2.5-2.6B 是一款專為端側裝置(On-device)設計的「代理型(Agentic)」混合基礎模型。這款僅有 26 億參數(實際總參數約為 2.69B)的模型體積小巧,其核心設計目標是讓手機、個人電腦或一般 CPU 就能在本地端獨立且流暢地處理複雜的多步驟任務。這使得開發者可以在本地硬體上大規模並行執行多個背景代理,無需負擔高昂的雲端 API Token 費用,並能同步實現極低的延遲、完全的隱私保護與全天候的離線運作。
核心架構特色:自帶「思考」機制的純推理模型
不同於傳統的輕量化模型,LFM2.5-2.6B 引入了以下獨特且深度的技術架構:
- 混合架構設計(Hybrid Architecture): 模型共有 30 層,由 22 個雙門控短卷積塊(Double-gated short convolution blocks)與 8 個群組查詢注意力(GQA)層混合構成。這種創新的 LFM2 結構使其兼具卷積的高效吞吐量與注意力的長程依賴處理能力。
- 「純推理」與內建思考(Pure Reasoning with
<think>): LFM2.5-2.6B 是一款純推理模型(Pure reasoning model)。它在回答問題前總是會先進行深度思考,並會在 ChatML 風格的對話模板中自動在回答開頭注入<think>標記,展示其內部的思維鏈(CoT)推理過程。 - 原位分詞器擴展(In-place Tokenizer Expansion): 為了在不重新從頭訓練底座模型的前提下加強多語言支持,研發團隊直接將詞彙量(Vocabulary)加倍擴展至 128,000 (128K)。
- 超長上下文支援: 在中期預訓練(Mid-training)階段,模型經歷了專門的 128K(131,072 tokens)上下文擴展訓練,這使其能輕鬆應對 RAG 和複雜代理工作流所需的大量歷史上下文與文檔輸入。
四階段深度後訓練(Post-training Pipeline)
為了將預訓練底座(LFM2.5-2.6B-Base)轉化為具備強大代理能力的模型,Liquid AI 採用了高度複雜的四階段後訓練管道:
[ LFM2.5-2.6B-Base ]
│
▼
1. 雙階段 SFT (廣泛領域微調 ➔ 代理與推理技能特化,訓練集高達 8B 模型的 7 倍)
│
▼
2. 專家特殊化 (Teacher Specialization: 利用 SFT + 可驗證獎勵 RLVR 訓練多領域專家)
│
▼
3. 多領域在線策略蒸餾 (MOPD: 學生自主 rollout,多專家進行 Token 級路由與在線監督)
│
▼
4. 代理強化學習 (Agentic RL: 在真實 OpenClaw/Hermes 沙盒中以 GRPO 進行多輪對齊優化)
│
▼
[ LFM2.5-2.6B Agentic ]
- 監督式微調(SFT): 分為兩個連續階段。第一階段覆蓋廣泛的基礎領域知識,第二階段則針對代理任務、邏輯推理和工具使用等核心技能進行高強度特化。此階段的 SFT 訓練混合料體積高達 LFM2.5-8B-A1B 的 7 倍,大幅向工具使用、軟體工程、網頁搜索與代理軌跡(Agent traces)傾斜。
- 專家特殊化(Teacher Specialization): 從 SFT 檢查點出發,利用特定領域數據與可驗證獎勵強化學習(RLVR, Reinforcement Learning with Verifiable Rewards),訓練出多個專屬專家老師(涵蓋指令遵循、數學、幻覺控制、代碼、工具調用和長上下文)。
- 多領域在線策略蒸餾(MOPD, Multi-Domain On-Policy Distillation): 不同於傳統離線蒸餾,MOPD 允許學生模型(LFM2.5-2.6B)在自己的策略下生成回答(Roll out),並由對應領域的專家老師提供即時、Token 級別的反饋監督。由於專家與學生擁有相同的 SFT 起點,這種在線反饋極其溫和且高效,能在不破壞模型穩定性的情況下快速聚合多領域能力。
- 代理強化學習(Agentic RL): 這是模型學會在真實環境中生存的關鍵。模型在 OpenClaw、Hermes Agent 等真實生產力 harness 沙盒環境中進行多輪端到端對齊,直接面對調用工具、執行代碼、文檔管理與自動化多步工作流。訓練使用 GRPO(群組相對策略優化)算法,並結合「LLM 作為裁判(LLM-as-a-judge)」、程序化規則檢查與硬性安全網進行結果導向的獎勵。
基準測試與性能評測
儘管 LFM2.5-2.6B 僅有 2.6B 參數,但在多項測試(特別是指令遵循與工具使用)中的表現足以媲美甚至超越體積大出四倍的模型:
| 基準測試 (Benchmark) | LFM2.5-2.6B (2.6B) | Qwen3.5-4B (4.7B) | gemma-4-E4B-it (8B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|
| IFStruct (指令結構化) | 85.49% | 36.25% | 76.65% | 78.50% |
| ToolSandbox (工具沙盒) | 77.83% | 75.55% | 65.00% | 76.44% |
| Claw-Eval Average (EN) | 62.85% | 62.28% | 58.02% | 66.53% |
| PinchBench | 68.22% | 71.26% | 55.09% | 71.45% |
| BrowseComp+ (OpenClaw) | 26.89% | 24.46% | 15.90% | 27.23% |
數據指出:LFM2.5-2.6B 在指令遵循與工具調用上表現亮眼,但在深度/重度代碼開發與超重知識型任務中,更大參數的模型(如 Qwen3.5-9B)仍保有傳統優勢。
端側與伺服器推理表現
在實際部署中,LFM2.5-2.6B 展現了其高效率架構的極致推理速度:
- 消費級硬體與邊緣 CPU: 運行時記憶體佔用保持在 2.5 GB 以下。
- Apple M5 Max: 解碼速度高達每秒 220 Tokens。
- AMD Ryzen AI Max+ 395: 解碼速度可達每秒 113 Tokens。
- 智慧型手機(完全本機端): 亦可達到每秒 30 Tokens,讓離線端側 Agent 的響應達到即時、流暢的體驗。
- GPU 伺服器端: 在 NVIDIA H100 SXM5 GPU 的高併發(High Concurrency)負載下,其輸出吞吐量可達到每秒 15,000 個 Tokens(約合單張卡每天處理 13 億個 Tokens)。
開發者實戰:快速載入與 Python 推理
在本地環境中,開發者需要確保已安裝 transformers>=5.0.0。以下是使用 Hugging Face Transformers 的標準自回歸文本生成程式碼範例:
from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer
import torch
model_id = "LiquidAI/LFM2.5-2.6B"
# 載入模型(自動配置設備,建議使用 bfloat16 以確保數值穩定性)
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype=torch.bfloat16,
# attn_implementation="flash_attention_2" # 在支援 CUDA 的 GPU 上取消註釋以進一步加速
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
# 設置流式輸出器
streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)
# 代理任務提示詞
prompt = "請幫我分析:如何使用 C. elegans 的神經系統建立一個具備 500k 參數的稀疏遞歸神經圖模型?"
# 套用 ChatML 對話模板
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
)["input_ids"].to(model.device)
# 模型將會在回答開頭自動輸出其 <think> 思考過程
output = model.generate(
input_ids,
do_sample=True,
temperature=0.1,
top_k=50,
repetition_penalty=1.1,
max_new_tokens=1024,
streamer=streamer,
)
開發者常見問題
Q:LFM2.5-2.6B 與 LFM2.5-VL-3B 在定位上有何不同?
LFM2.5-2.6B 是一款純文字、專注於多步 Agent 鏈條、工具調用和中介決策邏輯的「思考型」推理模型;而 LFM2.5-VL-3B 則是整合了 SigLIP2 視覺編碼器的多模態模型,專注於即時的 OCR、UI 導航與螢幕定位任務,其特點是直接給出回答(Answer directly)而非像 2.6B 這般進行複雜的 <think> 思考。
Q:它如何原生執行工具調用(Tool Use)?
LFM2.5 預設支持 Python 風格的函數調用。它會將函數定義作為 JSON 傳入 System 提示詞中(亦可直接使用 apply_chat_template 傳入 tools 參數),並在推理時自動將其輸出為 <|tool_call_start|>[get_status(id="123")]<|tool_call_end|> 的格式,便於下游沙盒程序攔截並執行。
Q:在邊緣部署中,有哪些優秀的推論後端推薦?
- 本機 CPU / 行動端: 強烈建議下載 GGUF 格式並使用 llama.cpp 或 LM Studio。
- Mac 裝置(Apple Silicon): 請使用專門針對 Apple Silicon 優化的 MLX 框架,能取得極致的 220 tok/s 的解碼速度。
- 高吞吐 GPU 伺服器: 推薦使用 vLLM 或 SGLang 部署為 OpenAI 相容的 API 介面。
結語
LFM2.5-2.6B 的發布打破了「端側模型無法承載複雜 Agentic 任務」的刻板印象。透過在線策略蒸餾與多輪真實沙盒強化學習,Liquid AI 成功將一個 2.6B 的輕量級底座打磨成了具備頂尖推理與工具操控能力的邊緣端特工。
如果您對本地微調或進一步整合感興趣,請造訪 HuggingFace 模型頁面 以及 Liquid AI 官方文檔 獲取最新指引。

圖片來源: LFM2.5-2.6B Evaluations



