tool

Liquid AI 推出 LFM2.5-2.6B:專為地端裝置設計的高效能 Agent 模型

August 13, 2026
Updated Aug 13
2 min read
Liquid AI 推出 LFM2.5-2.6B:專為地端裝置設計的高效能 Agent 模型

LFM2.5-2.6B:讓 AI 代理在裝置端運作

Liquid AI 推出的 LFM2.5-2.6B 是一款專為端側裝置(On-device)設計的「代理型(Agentic)」混合基礎模型。這款僅有 26 億參數(實際總參數約為 2.69B)的模型體積小巧,其核心設計目標是讓手機、個人電腦或一般 CPU 就能在本地端獨立且流暢地處理複雜的多步驟任務。這使得開發者可以在本地硬體上大規模並行執行多個背景代理,無需負擔高昂的雲端 API Token 費用,並能同步實現極低的延遲、完全的隱私保護與全天候的離線運作。

圖片來源: LiquidAI/LFM2.5-2.6B · Hugging Face

核心架構特色:自帶「思考」機制的純推理模型

不同於傳統的輕量化模型,LFM2.5-2.6B 引入了以下獨特且深度的技術架構:

  • 混合架構設計(Hybrid Architecture): 模型共有 30 層,由 22 個雙門控短卷積塊(Double-gated short convolution blocks)與 8 個群組查詢注意力(GQA)層混合構成。這種創新的 LFM2 結構使其兼具卷積的高效吞吐量與注意力的長程依賴處理能力。
  • 「純推理」與內建思考(Pure Reasoning with <think>): LFM2.5-2.6B 是一款純推理模型(Pure reasoning model)。它在回答問題前總是會先進行深度思考,並會在 ChatML 風格的對話模板中自動在回答開頭注入 <think> 標記,展示其內部的思維鏈(CoT)推理過程。
  • 原位分詞器擴展(In-place Tokenizer Expansion): 為了在不重新從頭訓練底座模型的前提下加強多語言支持,研發團隊直接將詞彙量(Vocabulary)加倍擴展至 128,000 (128K)
  • 超長上下文支援: 在中期預訓練(Mid-training)階段,模型經歷了專門的 128K(131,072 tokens)上下文擴展訓練,這使其能輕鬆應對 RAG 和複雜代理工作流所需的大量歷史上下文與文檔輸入。

四階段深度後訓練(Post-training Pipeline)

為了將預訓練底座(LFM2.5-2.6B-Base)轉化為具備強大代理能力的模型,Liquid AI 採用了高度複雜的四階段後訓練管道:

[ LFM2.5-2.6B-Base ]
         │
         ▼
 1. 雙階段 SFT (廣泛領域微調 ➔ 代理與推理技能特化,訓練集高達 8B 模型的 7 倍)
         │
         ▼
 2. 專家特殊化 (Teacher Specialization: 利用 SFT + 可驗證獎勵 RLVR 訓練多領域專家)
         │
         ▼
 3. 多領域在線策略蒸餾 (MOPD: 學生自主 rollout,多專家進行 Token 級路由與在線監督)
         │
         ▼
 4. 代理強化學習 (Agentic RL: 在真實 OpenClaw/Hermes 沙盒中以 GRPO 進行多輪對齊優化)
         │
         ▼
[ LFM2.5-2.6B Agentic ]
  1. 監督式微調(SFT): 分為兩個連續階段。第一階段覆蓋廣泛的基礎領域知識,第二階段則針對代理任務、邏輯推理和工具使用等核心技能進行高強度特化。此階段的 SFT 訓練混合料體積高達 LFM2.5-8B-A1B 的 7 倍,大幅向工具使用、軟體工程、網頁搜索與代理軌跡(Agent traces)傾斜。
  2. 專家特殊化(Teacher Specialization): 從 SFT 檢查點出發,利用特定領域數據與可驗證獎勵強化學習(RLVR, Reinforcement Learning with Verifiable Rewards),訓練出多個專屬專家老師(涵蓋指令遵循、數學、幻覺控制、代碼、工具調用和長上下文)。
  3. 多領域在線策略蒸餾(MOPD, Multi-Domain On-Policy Distillation): 不同於傳統離線蒸餾,MOPD 允許學生模型(LFM2.5-2.6B)在自己的策略下生成回答(Roll out),並由對應領域的專家老師提供即時、Token 級別的反饋監督。由於專家與學生擁有相同的 SFT 起點,這種在線反饋極其溫和且高效,能在不破壞模型穩定性的情況下快速聚合多領域能力。
  4. 代理強化學習(Agentic RL): 這是模型學會在真實環境中生存的關鍵。模型在 OpenClaw、Hermes Agent 等真實生產力 harness 沙盒環境中進行多輪端到端對齊,直接面對調用工具、執行代碼、文檔管理與自動化多步工作流。訓練使用 GRPO(群組相對策略優化)算法,並結合「LLM 作為裁判(LLM-as-a-judge)」、程序化規則檢查與硬性安全網進行結果導向的獎勵。

基準測試與性能評測

儘管 LFM2.5-2.6B 僅有 2.6B 參數,但在多項測試(特別是指令遵循與工具使用)中的表現足以媲美甚至超越體積大出四倍的模型:

基準測試 (Benchmark)LFM2.5-2.6B (2.6B)Qwen3.5-4B (4.7B)gemma-4-E4B-it (8B)Qwen3.5-9B (9.7B)
IFStruct (指令結構化)85.49%36.25%76.65%78.50%
ToolSandbox (工具沙盒)77.83%75.55%65.00%76.44%
Claw-Eval Average (EN)62.85%62.28%58.02%66.53%
PinchBench68.22%71.26%55.09%71.45%
BrowseComp+ (OpenClaw)26.89%24.46%15.90%27.23%

數據指出:LFM2.5-2.6B 在指令遵循與工具調用上表現亮眼,但在深度/重度代碼開發與超重知識型任務中,更大參數的模型(如 Qwen3.5-9B)仍保有傳統優勢。

端側與伺服器推理表現

在實際部署中,LFM2.5-2.6B 展現了其高效率架構的極致推理速度:

  • 消費級硬體與邊緣 CPU: 運行時記憶體佔用保持在 2.5 GB 以下
    • Apple M5 Max: 解碼速度高達每秒 220 Tokens
    • AMD Ryzen AI Max+ 395: 解碼速度可達每秒 113 Tokens
    • 智慧型手機(完全本機端): 亦可達到每秒 30 Tokens,讓離線端側 Agent 的響應達到即時、流暢的體驗。
  • GPU 伺服器端: 在 NVIDIA H100 SXM5 GPU 的高併發(High Concurrency)負載下,其輸出吞吐量可達到每秒 15,000 個 Tokens(約合單張卡每天處理 13 億個 Tokens)。

開發者實戰:快速載入與 Python 推理

在本地環境中,開發者需要確保已安裝 transformers>=5.0.0。以下是使用 Hugging Face Transformers 的標準自回歸文本生成程式碼範例:

from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer
import torch

model_id = "LiquidAI/LFM2.5-2.6B"

# 載入模型(自動配置設備,建議使用 bfloat16 以確保數值穩定性)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype=torch.bfloat16,
    # attn_implementation="flash_attention_2" # 在支援 CUDA 的 GPU 上取消註釋以進一步加速
)
tokenizer = AutoTokenizer.from_pretrained(model_id)

# 設置流式輸出器
streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)

# 代理任務提示詞
prompt = "請幫我分析:如何使用 C. elegans 的神經系統建立一個具備 500k 參數的稀疏遞歸神經圖模型?"

# 套用 ChatML 對話模板
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True,
    return_tensors="pt",
    tokenize=True,
)["input_ids"].to(model.device)

# 模型將會在回答開頭自動輸出其 <think> 思考過程
output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.1,
    top_k=50,
    repetition_penalty=1.1,
    max_new_tokens=1024,
    streamer=streamer,
)

開發者常見問題

Q:LFM2.5-2.6B 與 LFM2.5-VL-3B 在定位上有何不同? LFM2.5-2.6B 是一款純文字、專注於多步 Agent 鏈條、工具調用和中介決策邏輯的「思考型」推理模型;而 LFM2.5-VL-3B 則是整合了 SigLIP2 視覺編碼器的多模態模型,專注於即時的 OCR、UI 導航與螢幕定位任務,其特點是直接給出回答(Answer directly)而非像 2.6B 這般進行複雜的 <think> 思考。

Q:它如何原生執行工具調用(Tool Use)? LFM2.5 預設支持 Python 風格的函數調用。它會將函數定義作為 JSON 傳入 System 提示詞中(亦可直接使用 apply_chat_template 傳入 tools 參數),並在推理時自動將其輸出為 <|tool_call_start|>[get_status(id="123")]<|tool_call_end|> 的格式,便於下游沙盒程序攔截並執行。

Q:在邊緣部署中,有哪些優秀的推論後端推薦?

  • 本機 CPU / 行動端: 強烈建議下載 GGUF 格式並使用 llama.cppLM Studio
  • Mac 裝置(Apple Silicon): 請使用專門針對 Apple Silicon 優化的 MLX 框架,能取得極致的 220 tok/s 的解碼速度。
  • 高吞吐 GPU 伺服器: 推薦使用 vLLMSGLang 部署為 OpenAI 相容的 API 介面。

結語

LFM2.5-2.6B 的發布打破了「端側模型無法承載複雜 Agentic 任務」的刻板印象。透過在線策略蒸餾與多輪真實沙盒強化學習,Liquid AI 成功將一個 2.6B 的輕量級底座打磨成了具備頂尖推理與工具操控能力的邊緣端特工。

如果您對本地微調或進一步整合感興趣,請造訪 HuggingFace 模型頁面 以及 Liquid AI 官方文檔 獲取最新指引。

LFM2.5-2.6B Evaluations

圖片來源: LFM2.5-2.6B Evaluations

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.