TOOL FIELD NOTE

Liquid AI 開源決策模型 d1-3B:單次前向傳播的多模態判斷架構解析

Liquid AI 開源決策模型 d1-3B:單次前向傳播的多模態判斷架構解析 本篇介紹 Liquid AI 開源的 3.12B 多模態決策模型 d1-3B。文章深入探討其單次前向傳播、零輸出 Token 的技術特點,整理在 Decision Index 與邊緣硬體上的延遲測試數據,並說明該模型在分類、路由與安全防護等任務中的實際應用情境。 在多數自動化流程與系統閘道中,系統往往只需要明確的分類標籤、布林值或數值評分,而非冗長的對話回覆。傳統生成式大型語言模型仰賴自回歸生成,每產出一個 Token 就需執行一次運 …

PUBLISHED 2026.10.10
READING TIME 2 MIN
UPDATED 2026.10.10
01

COMMUNEIFY
INSIGHTS

把複雜的技術趨勢,整理成值得慢慢讀完的深度內容。

Liquid AI 開源決策模型 d1-3B:單次前向傳播的多模態判斷架構解析

本篇介紹 Liquid AI 開源的 3.12B 多模態決策模型 d1-3B。文章深入探討其單次前向傳播、零輸出 Token 的技術特點,整理在 Decision Index 與邊緣硬體上的延遲測試數據,並說明該模型在分類、路由與安全防護等任務中的實際應用情境。

在多數自動化流程與系統閘道中,系統往往只需要明確的分類標籤、布林值或數值評分,而非冗長的對話回覆。傳統生成式大型語言模型仰賴自回歸生成,每產出一個 Token 就需執行一次運算,導致推論延遲與伺服器成本居高不下。

針對這類任務導向的判定需求,Liquid AI 釋出了開源權重模型 LiquidAI/d1-3B 模型頁面,並在 官方發布公告 中公布了架構細節與測試指標。d1-3B 並非文字生成模型,而是專門用於單次輸入、立即給出校準判斷結果的決策模型。

什麼是決策模型:零輸出 Token 與單次前向傳播機制

一般語言模型在接收 Prompt 後,會逐字生成字串回應,需要反覆調用模型權重。d1-3B 採取不同的設計方向,將推論目標限定於狀態理解與預設問題的解答。

模型接受一個狀態(包含純文字、JSON 格式資料、圖片或兩者混合)以及一組預設問題。在一次前向傳播的過程中,模型會直接輸出帶有類型標註與信心分數的判斷結果。

這種設計使模型的輸出 Token 數維持在零(output_tokens: 0)。因為不需要自回歸解碼,推論延遲大幅降低,輸出結果也能直接對接既有程式的資料結構,不需要再撰寫正則表達式或額外解析 JSON 字串。

三種標準問題型態與校準機制

d1-3B 遵循 Decision Index 的結構定義,主要支援三種提問型態:

  1. 布林判斷(noul):判斷特定條件是否成立,回傳成立的機率值 P(yes)。
  2. 選項分類(choice):從預先定義的具名選項中挑選最符合的一項,並回傳各選項機率與總體信心度。
  3. 程度評分(score):在兩階至十階的有序等級中給予評分,回傳期望數值等級、機率分佈與對應說明。

由於模型經過專門的校準訓練,輸出的機率值更貼近真實信心水準,適合用於自動化分流與門檻過濾。

d1-3B 的核心規格與訓練方法

根據官方技術文件與 LFM2 技術報告,d1-3B 擁有約 3.12B 參數,基礎模型衍生自 Liquid AI 自家的視覺語言模型 LFM2.5-VL-3B。

硬體規格與架構組成

d1-3B 的主要架構規格包含:

  • 參數量:3.12B
  • 視覺編碼器:SigLIP2 NaFlex 形狀優化架構(約 400M 參數)
  • 上下文長度:32,768 tokens
  • 詞表大小:128,000

模型在視覺處理上整合了 SigLIP2 編碼器,支援原生形狀優化輸入,能直接處理不同長寬比的圖像,而不需要強制扭曲或過度裁切。

權重合併與資料訓練策略

在訓練過程中,開發團隊將純文字模型 LFM2.5-2.6B 的權重與 LFM2.5-VL-3B 的文字骨幹進行平均融合,建立表現更穩定的基礎權重。

隨後,團隊使用不同隨機重設值與資料配比進行微調,最後再次進行權重合併。官方指出,增加長文本訓練資料、打亂選項順序以消除模型的位置偏見,以及修正資料集中存在的捷徑特徵,對提升判斷穩定度產生了實質幫助。

基準測試與推論速度表現

評估決策模型的效能時,重點在於任務判斷的正確率與推論延遲。

Decision Index 0.2.1 測試數據

在針對決策模型設計的 Decision Index 0.2.1 公開榜單測試中,官方使用官方計分器進行了 120,226 次請求評測。d1-3B 取得了 48.57 分的綜合成績。

在該項指標中,d1-3B 的得分超越了榜單上參數量在 10B 以下的其他受測模型,例如 JPT-9B(46.89 分)、Decision 1.0 Lux(43.49 分)與 JPT-4B(43.04 分),同時也高於參數量達 36B 的混合專家模型 Decider 35B-A3B(47.11 分)。在工具調用與語言理解分項上,d1-3B 分別獲得 74.5 與 56.4 的成績。

在包含 SQuAD 2.0、Civil Comments、MASSIVE 意圖分類、PubMedQA、BoolQ、XNLI 與 PAWS-X 等七項公開文字基準測試中,d1-3B 的平均準確率為 77.1 分。

影像基準測試結果

在 11 項公開影像基準測試(包含 AI2D、BLINK、CV-Bench、MMBench、POPE 等)中,d1-3B 的平均得分為 74.1,與原本的通用基礎模型 LFM2.5-VL-3B(73.9 分)維持相當水準。當團隊在實驗中移除圖像輸入、僅保留問題文字時,得分降至 45.1,顯示其決策確實建立在對圖像內容的解析之上。

伺服器與邊緣裝置的推論延遲

因為不需要自回歸生成,d1-3B 在推論延遲上有具體表現。官方公布了不同硬體在單次查詢下的測試數據:

在資料中心與工作站 GPU 上:

  • NVIDIA RTX 4090:單一問題回答耗時約 8 毫秒(啟用 CUDA graphs 編譯模式),在單一狀態同時回答 3 個問題約 21 毫秒,處理 3.4K tokens 狀態約 102 毫秒,透過批次封裝 64 個狀態時吞吐量達到每秒 475 次請求。
  • AMD MI325X:單一問題回答耗時約 9 毫秒,3 個問題約 14 毫秒,批次吞吐量約每秒 1,106 次請求。

在邊緣運算裝置上:

  • Apple M5 Pro(使用 MPS):單一問題約 30 毫秒,3 個問題約 41 毫秒。
  • NVIDIA Jetson AGX Thor:單一問題約 16 毫秒,3 個問題約 20 毫秒。
  • NVIDIA Jetson AGX Orin 64GB:單一問題約 26 毫秒,3 個問題約 35 毫秒。
  • NVIDIA Jetson Orin Nano:單一問題約 50 毫秒,處理 384 像素圖像約 202 毫秒。

測試數據顯示,當輸入同一狀態並同時提出多個問題時,運算時間僅微幅增加,這是因為文字與圖像特徵在單次前向傳播中只需被讀取編碼一次。

適用情境與程式整合方式

d1-3B 適合置於複雜 AI Pipeline 的前置節點或監控端點,執行快速分流。

主要應用情境

  • 意圖分類與客服工單路由:在接收到使用者訊息時,立即分類該問題屬於技術支援、帳務退款或一般諮詢。
  • 內容審核與安全性檢查:檢測輸入內容是否包含不當言論或惡意 Prompt 注入。
  • 代理人 Guardrails 與工具選擇:在呼叫成本較高的多模態大模型之前,先行判定任務是否需要調用特定外部工具。
  • 即時影像檢驗:透過攝影機串流進行手勢判定、物件狀態標記或工廠流水線瑕疵篩選。使用者可於 Hugging Face 上的 Open d1 Arcade 體驗空間 測試包含視訊鏡頭互動在內的各項即時範例。

程式碼調用與推論框架支援

開發者可透過標準 Python 環境與 Transformers 函式庫載入模型。載入時需指定 trust_remote_code=True:

import torch
from transformers import AutoModel

device = "cuda" if torch.cuda.is_available() else "cpu"
dtype = torch.float32 if device == "cpu" else torch.bfloat16

model = AutoModel.from_pretrained(
    "LiquidAI/d1-3B",
    trust_remote_code=True,
    dtype=dtype
).to(device)

questions = {
    "refund": {
        "type": "noul",
        "instructions": "Is the customer asking for a refund?",
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent is this ticket?",
        "criteria": ["Low", "Normal", "High", "Critical"],
    }
}

response = model.system_one("I was charged twice, please refund.", questions)
print(response)

除了原生 Transformers 以外,d1-3B 也支援 vLLM、SGLang、Docker Model Runner 以及 llama.cpp,方便在不同架構的伺服器與邊緣裝置中進行部署。

常見問題

d1-3B 可以用來撰寫文章或當作聊天機器人嗎?

無法。d1-3B 不是對話型語言模型,不具備自回歸文字生成能力。它的輸出 Token 數為零,只會回傳符合結構化定義的選項、分數或布林機率值。

決策模型與一般 LLM 的輸出格式有何不同?

一般 LLM 輸出的是未結構化的自然語言文字串,通常需要額外的 Prompt 工程或字串解析才能提取結論。d1-3B 回傳的是標準結構化字典,內含預測選項名稱、信心指數與各類別機率分佈,便於後續程式邏輯直接判斷。

為什麼在單一狀態下詢問多個問題,推論時間增加有限?

因為模型的計算主要集中在對狀態(文本與圖像)的編碼理解。在 system_one 調用中,狀態與影像特徵只會被讀取計算一次,多個問題是在同一次前向傳播中平行處理,因此增加問題數量對整體延遲的影響相對輕微。

結語

Liquid AI 開源的 d1-3B 展示了專用決策模型在特定自動化環節中的實用性。透過捨棄自回歸生成、專注於單次前向傳播的架構,該模型在維持 3B 級參數量的情況下,提供了低於數十毫秒的推論回應速度,為邊緣運算與大型管線分流提供了一種輕量化的配置選擇。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.