開源決策模型 Kev 解析:以 Qwen 為基底的輕量化分類與機率校準架構
由 Jared Palmer 開源的決策模型家族 Kev,以 Qwen 系列為基礎構建,提供 0.8B 至 27B 等不同規格。本文整理 Kev 的核心架構、API 介面、機率校準輸出、微調方法與部署流程,協助開發者了解如何在本機或雲端建立高效率的自動化判斷系統。
在客服分流、工單標記與政策審查等流程中,使用大型文字生成模型處理單純的分類問題,往往面臨延遲過高與輸出格式不穩定的限制。Jared Palmer 開發的開源模型專案 Kev,針對這類決策場景提出了專門解法。
Kev 採用決策導向的設計架構,能夠在單次請求中針對同一段輸入文字同時處理多道問題,並直接輸出經過統計校準的機率分佈。這項專案目前已在 GitHub 專案庫 開放程式碼,並於 Hugging Face 模型收藏庫 提供各尺寸預訓練權重,開發者也能直接利用 Hugging Face Space 線上展示 透過瀏覽器免安裝測試。
Kev 的架構設計與核心特點
Kev 的設計理念參考了 TypeSafe 旗下 Jev 模型的架構思維,專注於精確的文字判斷與標籤分類,而非開放式的文字生成。
在請求處理上,Kev 支援三種提問型態:
- 是非題(noul):評估特定陳述是否成立,輸出介於 0 與 1 之間的肯定機率。
- 單選題(choice):提供 1 至 255 個選項與說明,輸出最合適的類別、各選項機率與信心指數。
- 評分題(score):給予有序的等級標準,輸出加權後的連續評分、等級分佈與信心值。
這三類問題可以打包在同一筆請求中發送。所有問題共用底層文字上下文,但模型在推論時具有問題隔離機制,各問題之間無法互相讀取對方的判斷內容,避免單一問題的推論過程干擾其他題目的客觀性。
此外,Kev 原生具備機率校準能力。一般語言模型輸出的機率往往過於自信,Kev 每個發布版本都在保留資料集上調校了溫度參數(Temperature),使輸出的機率值更貼近真實錯誤率。
模型規格與效能表現
Kev 家族目前規劃了四種主力尺寸,分別對應不同的運算資源與準確度要求。
模型尺寸與硬體配置
Kev-0.8B、Kev-4B 與 Kev-9B 以 Qwen3.5 Base 模型為基底,採用凍結基底模型並疊加轉接層的方式訓練。這讓模型能以輕量權重發布,方便快速下載與更新:
- Kev-0.8B:適合邊緣端或一般 Apple Silicon Mac,亦可運行於 L4 GPU。
- Kev-4B:官方建議的標準起步模型,在 32 GB 記憶體的 Mac、L40S 或 H100 運作順暢。
- Kev-9B:適用於具備充足 GPU 記憶體的推論伺服器,進一步提升分類精度。
- Kev-27B:以 Qwen3.8-27B 後訓練版本為基底,進行全權重微調,權重檔案約 51 GB,需要 H100、H200 或 96 GB 以上記憶體的裝置。
先前的 v0.1 原型版本 Kev-0.5B 則保留在收藏庫中供研究對照,官方建議生產環境採用 0.8B 以上規格。
基準測試與推論速度
根據官方測試數據,在未參與訓練的新資料來源(New Sources)測試中,Kev-27B 的準確率達到 0.851,與閉源的 Jev(0.857)差距在 1 個百分點以內。在綜合機率分佈評估的 Brier 分數上,數值越低越佳,Kev-27B 取得 0.225,同樣接近 Jev 的 0.211。
在推論效率方面,官方測試顯示 Kev-4B 在 H100 GPU 上處理包含六個問題的短文字時,模型運算時間約為 18.1 毫秒,單一容器每秒可處理約 101 個請求。在 Apple M5 晶片上,五個問題的推論時間約為 721 毫秒,若輸入文字命中快取,延遲可降低至 136 毫秒。
文本長度支援部分,服務端最高允許 65,536 個字元標元(tokens)的輸入狀態,每個問題則可支援 8,192 個標元。小尺寸模型在超長文本上的準確率相對有限,長篇合約等複雜文件則更適合由 Kev-27B 處理。
本機運作與 API 介面串接
Kev 支援多種推論後端,包括 CUDA、ROCm 以及針對 Apple Silicon 的 MLX 架構。
環境需求為 Python 3.12 或 3.13,可透過 uv 套件管理工具快速完成安裝與服務啟動:
git clone https://github.com/jaredpalmer/kev.git && cd kev
uv sync --extra serve
uv run --extra serve python -m kev.serve --run jaredpalmer/kev-4b --port 8009
啟動後,本機伺服器會在 8009 埠提供符合 TypeSafe System One 規格的 API 端點。客戶端發送 POST 請求至 /v1/systemone,即可傳入文字與問題定義。
以 Python 程式庫呼叫為例,如果原本已有使用 TypeSafe SDK 的程式碼,可以直接將 base_url 導向本機服務:
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient(
api_key="local",
base_url="http://127.0.0.1:8009",
model="kev-latest",
)
response = client.system_one(
state="我被重複扣款了兩次,請盡快協助退款。",
questions={
"billing": Noul(instructions="這張工單是否與帳單問題有關?"),
"tone": Choice(
instructions="客戶語氣如何?",
criteria={"calm": "平靜", "frustrated": "感到沮喪", "angry": "非常憤怒"},
),
"urgency": Score(
instructions="緊急程度評分",
criteria=["可稍後處理", "本週處理", "今日必須處理"],
),
},
)
由於模型回傳的是完整機率分佈與信心值,工程團隊可以在業務邏輯中設定閾值,例如當分類信心值超過 0.85 時交由系統自動派案,低於標準時則分流至人工客服審核,降低自動化誤判帶來的風險。
自訂資料微調與雲端部署
公開發布的預訓練權重主要針對通用邏輯與常見資料集,如果面對企業特有的業務標籤、特殊規則或非英語語境,進行微調能顯著提升效果。
標註資料格式與手動微調
微調資料集採用 JSONL 格式,每一行包含輸入文本 state 與各題目的標註結果 label。
在 choice 題目中標註選項名稱,noul 標註 true 或 false,score 則標註整數層級索引。準備好資料後,即可透過命令列執行訓練:
uv run python -m kev.train \
--data train.jsonl \
--base Qwen/Qwen3.5-4B-Base \
--init_from jaredpalmer/kev-4b \
--epochs 2 \
--lr 2e-5 \
--batch 1 \
--accum 8 \
--dtype bf16 \
--device cuda \
--out runs/custom-model
使用 --init_from 參數載入已發布的檢查點極為重要。官方實驗顯示,直接從原始 Qwen 基底訓練會遺失現有的決策架構能力,在既有評測集上的分數顯著落後,而承接 Kev 現有權重微調則能在保留基礎能力之際,提升特定領域的精準度。
Agent 輔助訓練與 Modal 部署
對於使用程式輔助工具的開發者,專案提供了 kev-finetune 工具。透過安裝技能指令,代理程式會引導使用者分析現有題型、生成或轉換標註資料、在 Modal 雲端平台租用 GPU 完成微調並重新計算溫度參數。官方評測指出,在 5,219 筆金融投訴資料上進行單個 epoch 的微調,可使 Kev-4B 在未見投訴資料上的準確率由 0.804 提升至 0.904。
雲端部署方面,專案支援透過 Modal 部署無伺服器(Serverless)端點。使用者在設定好金鑰與部署腳本後,可將 Kev 託管為具備 HTTPS 與 Bearer 認證的線上服務。閒置時實例會縮容至零(Scale to Zero),避免持續佔用高成本 GPU 算力。
常見問題
Kev 與一般的生成式語言模型有何差異?
傳統語言模型設計以逐字生成文字為主,回傳結構化資料時需要依賴提示詞約束或外部工具解析,容易出現格式錯誤或機率未校準的情形。Kev 本質上是分類與評分導向的決策模型,不產生自由文字,而是專注於單次推論中產出數值型的機率分佈與信心指數。
Kev 能夠處理繁體中文等非英語內容嗎?
Kev 的基底模型 Qwen 具備多語言語料理解能力,在多數標準中文輸入下能直接進行意圖判斷與分類。但由於預訓練決策層包含大量英語樣本,遇到專業術語、在地口語或特定產業分類時,建議準備數百至數千筆本機標註資料進行微調,以確保分類標準與信心校準更貼合實際業務場景。
如何在沒有獨立 GPU 的環境下進行測試?
開發者若暫時沒有高效能 GPU,可以透過瀏覽器前往 Hugging Face Space 線上展示 直接體驗 Kev-4B 與 Kev-0.8B 的推論效果。若需要在本機開發,搭載 Apple Silicon 的 Mac 可透過內建 MLX 後端直接運行 0.8B 或 4B 版本。
結語
Kev 透過將 Qwen 模型轉譯為結構化決策引擎,補足了語言模型在機率判斷與分類應用上的工程需求。無論是需要低延遲本機部署的小型應用,或是需要高吞吐量的雲端客服分流,這套開源方案都提供了清楚的訓練與整合路徑。

