Perplexity 開源決策模型 pplx-decider-v1-27b,推出每百萬 Token 僅 0.04 美元的 Decisions API
Perplexity 正式開源 270 億參數的多模態決策模型 pplx-decider-v1-27b,並同步推出 Decisions API。這款模型專注於分類、路由與規則評分,直接回傳結構化機率數值,免除傳統對話模型繁複的文字解析流程,以極低延遲與透明計價提供開發者高效率的系統決策工具。
在現行的軟體開發流程中,許多團隊會呼叫大型語言模型處理分類、內容審核或工單分派等任務。傳統聊天模型通常以長篇文字或 JSON 格式回覆,開發端必須額外編寫解析邏輯,還得承擔格式損毀或非預期回覆的風險。
針對這類結構化判斷需求,Perplexity Developers 在社群平台 X 的發布公告(
)中宣布推出專門設計的決策模型,同時在 Hugging Face 上的 pplx-decider-v1-27b 模型頁面 公開開源權重,並於雲端提供對應的 Decisions API 服務。什麼是決策模型:拋棄文字生成,直接輸出校準機率
決策模型(Decision Model)的運作邏輯與一般生成式模型有明顯差異。一般對話模型在收到問題後會逐字生成回答或解說推理過程,決策模型則完全不生成自由文字、不編寫程式碼,也不輸出自我解釋。
它的核心任務是閱讀文字、JSON 或是圖片輸入,在單次前向傳播(Forward Pass)中直接產出具備明確型別定義的數值與校準機率(Calibrated Probabilities)。開發者可以直接使用回傳的浮點數機率與閥值(Threshold)進行比較,交由下游程式碼接手邏輯判斷。
三種原生問題型別
根據 Perplexity Decisions API 官方技術文件 的規範,呼叫該模型時可以針對同一份輸入內容同時提出多個具名問題,模型支援三種決策型態:
- noul(布林判斷):用於是非題檢驗,回傳 0 到 1 之間的數值,代表結果為真(Yes)的機率。數值若接近 0.5 則表示模型判斷信心不足。
- choice(類別選擇):適用於分類或工單路由,開發者可定義 1 到 255 個選項及判定條件。模型會回傳機率最高的選項名稱、該選項的信心指數,以及所有選項各自的機率分配。
- score(階梯評分):依照開發者自訂的有序量表(最多 10 個等級)給分。模型輸出包含期望加權分數(Score)、各等級的機率分布,以及對應等級說明的標籤對照表。
支援多模態輸入與本地部屬規格
除了純文字與結構化物件,pplx-decider-v1-27b 也具備多模態處理能力。
在呼叫 API 時,輸入內容可以直接包含圖片的 Base64 格式編碼(支援 PNG、JPEG 與 WebP)。模型以 32 × 32 像素的圖塊(Tiles)讀取影像,單張影像上限為 2,048 個圖塊,例如 1440 × 1440 或 2048 × 1024 像素的規格。
在模型開源方面,該模型以 Apache-2.0 授權條款釋出。模型基底是基於 Qwen3.8-27B 進行微調,參數量約 260 億。如果開發者要在自己的硬體環境執行本地推論,官方建議使用 Python 3.12 以上版本,且 CUDA GPU 需要具備容納約 49 GiB 權重與工作記憶體的顯存空間。
from inference import Decider
model = Decider.from_pretrained("perplexity-ai/pplx-decider-v1-27b")
result = model.predict(
"My Stripe integration keeps failing. Please help ASAP.",
{
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Charges and refunds",
"technical_support": "Integration errors",
"sales": "Questions about buying a product",
},
},
)
print(result)
基準測試數據與市場競爭定位
在官方公布的評測標準中,pplx-decider-v1-27b 在 11 項基準測試上與基底模型 Qwen3.8-27B 以及 TypeSafe 開發的決策模型 Jev 進行了對比。
| 測試基準(Benchmark) | TypeSafe Jev | Qwen3.8-27B | pplx-decider-v1-27b |
|---|---|---|---|
| WinoGrande | 90.70% | 73.10% | 83.30% |
| FinancialPhraseBank | 76.98% | 75.68% | 84.18% |
| RAGTruth | 77.27% | 61.53% | 88.80% |
| JudgeBench | 78.57% | 68.86% | 78.29% |
| BBH | 94.27% | 72.80% | 82.80% |
| JevBench public hard | 73.27% | 72.28% | 70.30% |
| TabFact | 89.80% | 78.60% | 90.60% |
| ContractNLI | 77.45% | 80.78% | 80.78% |
| Circa | 84.60% | 87.00% | 89.20% |
| Belebele | 95.00% | 93.20% | 94.00% |
| TruthfulQA binary | 92.00% | 82.80% | 85.40% |
| 整體平均(Overall) | 84.51% | 74.76% | 85.71% |
在官方測試環境下,pplx-decider-v1-27b 整體平均準確率達到 85.71%,高於基底 Qwen3.8-27B 的 74.76%,也微幅超越 Jev 的 84.51%。特別是在檢驗檢索增強生成真實性的 RAGTruth(88.80%)與表格推論的 TabFact(90.60%)項目上取得較突出的成績。
Decisions API 計價與使用限制
對於不打算自建 GPU 伺服器的團隊,Perplexity 開放了託管版本的 Decisions API。
這項 API 採用極為精簡的收費結構:每百萬輸入 Token 費用為 0.04 美元。由於模型不生成文字,所有輸出 Token 完全免費,也不收取額外的每請求呼叫費。
在請求配額與限制方面:
- 單次請求最多可同時掛載 128 個具名問題。
- 輸入 Token 上限為 262,144,包含狀態文字、圖片以及所有問題內容。
- 單一 HTTP 請求內容上限為 32 MiB。
- API 預設速率限制為每秒 10 次請求(10 RPS)。
常見問題
決策模型可以用來替換 ChatGPT 或 Claude 這類聊天機器人嗎?
無法替換。決策模型並非對話助理,它缺乏自然語言生成與對話功能,無法產出文章、對話回覆或撰寫程式碼。它的功能是判斷與分類,回傳機率數值供既有系統程式判定走向。
既然輸出不產生文字,為什麼需要 27B 這麼大的參數量?
複雜的邏輯判斷(例如法規合規檢查、財務情緒分析或多模態圖文辨識)需要足夠的世界知識與語意理解能力。透過 27B 等級的多模態模型微調,能確保在理解複雜背景後,依然能精確輸出具備高校準度的機率分布。
什麼情境適合使用 Decisions API?
適合自動化流程中的閥值過濾,例如客服工單團隊路由、評論內容情緒標記、文件等級審核、以及多步驟 Agent 系統中的前置判斷。
結語
Perplexity 透過開源 pplx-decider-v1-27b 與提供低門檻的 Decisions API,針對自動化流程中的判斷環節給出了具體的解決方案。對於需要穩定輸出結構化數值、且重視維運成本的軟體工程團隊而言,這種回歸數值與機率判定的架構,提供了一條不同於傳統文字生成模型的實用路徑。

