Cloudflare 開源決策模型 Clef:架構原理、多模態支援與推論效能解析
Cloudflare 釋出基於 Apache-2.0 授權的開源決策模型 Clef 與 Clef-flash,主打單次前向傳遞即可輸出結構化機率,無須生成自由文字或進行字串解析。本文深入探討 Clef 的架構設計、多模態輸入支援、官方基準測試數據,以及在自動化代理工作流程中的實際應用。
近年來人工智慧領域多數目光集中在自迴歸大型語言模型,但這類模型在處理明確決策與分類任務時,往往存在推論延遲較長、輸出格式不穩定等問題。針對此類需求,市場開始出現專注於分類與確定性評估的決策模型(Decision Models)。Cloudflare 在 2026 年 10 月發布旗下首款開源決策模型 Cloudflare/clef,以 Qwen 系列為骨幹,將輸入狀態直接映射至結構化架構的選項機率,嘗試解決自動化流程中高頻率決策的效能瓶頸。
什麼是決策模型?Clef 的核心運作機制
決策模型不同於生成式語言模型,其目標不是產出開放式文章或對話,而是為預先定義的問題選項計算具體機率。傳統大型語言模型產生結構化輸出時,需要逐字生成 JSON 字串,再由程式進行解析,過程中容易因為格式偏差或幻覺而引發錯誤。
Clef 的運作方式則是給定一段狀態描述(State)與一組具備型別定義的問題架構(Schema),在單次前向傳遞中同時評估所有問題的每一個選項。模型直接計算各選項的未正規化對數機率(Logits),再透過 Softmax 轉換為標準機率,完全不經過文字生成階段,因此省略了中間的字串解析環節。
支援的三種問題型別
Clef 目前支援三種主要問題結構,涵蓋常見的判斷與分類場景:
- noul:二元布林判斷,輸出 True 或 False 的機率,常用於判斷事件是否發生或條件是否滿足。
- choice:具備名稱與文字說明的多選一分類,例如部門分流、工單分類或意圖識別。
- score:具備順序等級的評分,例如依照緊迫性、嚴重程度或優先級進行數字階層排列。
在 API 設計上,Clef 完全相容於 Typesafe AI 所提出的 Jev 與 SystemOne 規格,開發者可以沿用現有的請求介面直接替換後端推論引擎。
Clef 的模型架構與多模態特點
Clef 參數量為 27B,基礎模型採用 Qwen/Qwen3.8-27B 及其視覺編碼器(Vision Encoder),以 BF16 精度與標準 safetensors 格式存放。除了標準的 27B 版本,官方同時推出了參數量較小、推論速度更快的 Clef-flash,後者以 Qwen3.5-9B 為骨幹進行後續訓練。
非自迴歸推論與聯合架構頭部
傳統語言模型在推論時必須不斷將前一個 Token 餵回模型進行迴歸計算。Clef 在推論時僅執行單次預填充(Prefill-only pass),接著將骨幹網路最後一層的隱藏狀態傳送至專門設計的聯合架構頭部(Joint Schema Head)。
這個輕量 Transformer 頭部負責將狀態資訊路由至各個問題,讓不同欄位參數能夠互相進行交叉注意力計算,最後平行輸出所有問題選項的機率。這種設計大幅縮短了運算路徑,降低了推論時的計算開銷。
支援多模態輸入與 64k 脈絡長度
多數早期決策模型僅能處理純文字輸入,而 Clef 保留了視覺編碼器,可直接接收圖片(PIL Image)與影片影格陣列(Video frame arrays)。在處理包含發票收據、儀表板截圖或監控畫面的工作流程時,系統可以直接將多模態資料納入狀態評估。
此外,Clef 的上下文長度達到 64k Tokens,高於市場上常見同類模型(如 Jev 的 32k),允許開發者在狀態中放入更龐大的系統紀錄、合約全文或多張圖片。
訓練方法與機率校準
根據 Cloudflare 官方部落格介紹,研究團隊在訓練 Clef 時凍結了主幹模型權重,並針對路由頭部與 Rank-256 低秩適應器(LoRA)進行聯合最佳化。
在損失函數方面,團隊結合標籤平滑交叉熵(Label-smoothed cross-entropy)與布萊爾分數損失(Brier loss),強化模型預測機率的校準準確度。為了提升泛化能力,訓練流程引入校準決策強化學習(RLCD, Reinforcement Learning for Calibrated Decisions),針對排序相鄰的選項給予部分獎勵,促使模型給出的百分比機率更貼近真實統計分佈。
效能評測與延遲表現
評估決策模型的好壞通常依據兩個指標:分類判斷的準確度,以及請求回應的延遲時間。在針對各家模型進行的綜合測試中,官方公布了數項具代表性的數據。
Decision Index 評測結果
在決策基準測試套件 Decision Index 0.2.1 的結果中,Clef 與 Clef-flash 在多個項目取得顯著成績:
- 柏克萊函數調用基準(BFCL):Clef 準確率達到 98.47%,Clef-flash 達到 98.76%,高於 Jev 的 95.75%。
- 銀行意圖分類(BANKING77):Clef 的 Macro-F1 為 94.20,Clef-flash 為 90.93,對比 Jev 的 79.74。
- 意圖分類延伸集(CLINC150+OOS):Clef 達到 97.43 Macro-F1,在跨領域語音指令分類上展現穩定度。
- API 銀行調用(API-Bank):Clef 正確率為 91.93%,Clef-flash 為 93.11%。
詳細的各項基準排行榜已公開於 Decision Index 評測頁面 供外界查閱。
延遲數據與實際工作流程
在推論延遲方面,非自迴歸架構展現出明顯優勢。測試數據顯示:
- Clef(27B):中位數延遲約 209.3 毫秒,第 95 百分位延遲約 238.6 毫秒。
- Clef-flash(9B):中位數延遲約 38.8 毫秒,第 95 百分位延遲約 122.4 毫秒。
- 競品 Jev:中位數延遲約 524.1 毫秒,第 95 百分位延遲約 536.0 毫秒。
在實際業務場景中,Cloudflare 威脅情報團隊測試將 Clef 用於網站網域分類,搭配 Browser Run 抓取網頁渲染畫面並進行即時分類,整體耗時約 2.2 秒。相較之下,採用通用開源大模型 gpt-oss-120b 執行相同任務需耗費 4.7 秒,且分類維度較少。
如何使用與部署 Clef
Clef 採 Apache-2.0 授權條款開源,社群可以在 Hugging Face 的 Cloudflare/clef 專案頁面 取得模型權重、設定檔與推論程式碼。
本地與主流推論引擎支援
在單張具備足夠顯存的 GPU(如 NVIDIA H200)環境下,可透過 PyTorch 與 Hugging Face Transformers 直接載入:
from huggingface_hub import snapshot_download
import sys
import torch
path = snapshot_download("Cloudflare/clef")
sys.path.insert(0, path)
from joint_schema_model import load_release_model, encode_record, collate_records
model, processor = load_release_model(path, device="cuda")
除了原生腳本,社群生態亦支援透過 vLLM 與 SGLang 進行高吞吐量部署,相容於 OpenAI 形式的 API 呼叫規格,並提供 Docker 容器映像檔加速環境建置。
雲端邊緣託管與強化學習微調
對於偏好無伺服器架構的開發團隊,Cloudflare 已將 Clef 與 Clef-flash 部署於 Workers AI 平台,呼叫端點即可在邊緣節點執行推論。
同時,Cloudflare 也發表了客製化強化學習服務,結合 AI Gateway 收集請求資料、利用 Containers 建立評估沙盒,協助企業針對專屬內部資料(例如客服分類、工單派送或惡意流量辨識)對 Clef 進行進一步微調。
常見問題
決策模型與一般大語言模型有何本質差異?
一般大語言模型採用自迴歸機制逐字產生文字,適用於需要自由創作、長文生成或複雜推理的任務。決策模型則是針對給定的多個選擇題或評分題目,以非自迴歸方式直接輸出各選項機率,不輸出非結構化文字,推論延遲顯著降低且輸出格式完全確定。
Clef 可以離線本機部署嗎?
可以。Clef 的所有權重與推論腳本均已於 Hugging Face 公開,採用寬鬆的 Apache-2.0 授權,開發者只要具備相容的硬體環境,即可使用 Transformers、vLLM 或 SGLang 進行本地端私有化部署。
Clef 與 Clef-flash 該如何選擇?
兩者主要差異在於參數量與推論延遲。Clef 為 27B 規格,在複雜邏輯判斷與語言理解基準上精確度較高。Clef-flash 則基於 9B 骨幹,中位數延遲縮短至數十毫秒等級,適合對時間極度敏感的即時路由、網路安全過濾或高頻率決策流程。
結語
Clef 與 Clef-flash 的發布,為自動化工作流程中的條件分支與分類任務提供了專門的解決途徑。透過非自迴歸架構、多模態輸入支援與嚴格的型別機率輸出,這類模型能夠有效降低系統對通用大型語言模型的依賴與運算成本。目前模型權重已全數公開,開發者可依據實際業務的精確度與延遲需求,評估引入本機環境或雲端邊緣推論架構。

