跳至主要內容

主題選讀

#Benchmark

關於 Benchmark 的最新消息、技術解析與應用觀察。

23篇文章

主題文章

由新到舊,第 1 / 3 頁

Perplexity 開源決策模型 pplx-decider-v1-27b,推出每百萬 Token 僅 0.04 美元的 Decisions API

Perplexity 正式開源 270 億參數的多模態決策模型 pplx-decider-v1-27b,並同步推出 Decisions API。這款模型專注於分類、路由與規則評分,直接回傳結構化機率數值,免除傳統對話模型繁複的文字解析流程,以極低延遲與透明計價提供開發者高效率的系統決策工 …

AI 真的懂你嗎?全面解析 VitaBench 2.0 測試平台與長效記憶盲區

隨著大語言模型在指令執行與工具調用上取得突破,我們距離真正的「專屬虛擬管家」還有多遠?本文深入解析最新發布的 VitaBench 2.0 評測基準,帶您了解 AI 模型在面對真實世界中零碎的長期交互、動態偏好演化以及主動澄清需求時,所面臨的技術瓶頸。研究更揭露了一個反直覺的真相:幫 AI …

AI 模型繪圖能力大對決:9 款頂尖 LLM 的 SVG 生成實測

當大型語言模型開始挑戰「視覺程式碼」,誰才是真正的贏家?本文深入解析 Claude Sonnet 4.5、GPT-5.1、Gemini 3.0 等 9 款頂尖 AI 模型的 SVG 生成評測,探討這些模型在 30 個創意提示詞下的表現,並分析這對開發者與設計師意味著什麼。

© 2026 Communeify. All rights reserved.