Ai2 開源科學研究報告模型 AstaBrief 8B:以單次生成與引用過濾提升文獻綜述效率
艾倫人工智慧研究所開源 8B 參數規模的科學文獻報告模型 AstaBrief 8B,透過真實科研提問與引用密度過濾機制,讓模型具備單次生成附帶文獻引用報告的能力。本文解析 AstaBrief 的訓練架構、引用精確度表現以及本機部署應用。
主題選讀
關於 Benchmark 的最新消息、技術解析與應用觀察。
艾倫人工智慧研究所開源 8B 參數規模的科學文獻報告模型 AstaBrief 8B,透過真實科研提問與引用密度過濾機制,讓模型具備單次生成附帶文獻引用報告的能力。本文解析 AstaBrief 的訓練架構、引用精確度表現以及本機部署應用。
Perplexity 正式開源 270 億參數的多模態決策模型 pplx-decider-v1-27b,並同步推出 Decisions API。這款模型專注於分類、路由與規則評分,直接回傳結構化機率數值,免除傳統對話模型繁複的文字解析流程,以極低延遲與透明計價提供開發者高效率的系統決策工 …
Perplexity 與 turbopuffer 合作發布 pplx-embed-v2-context-9b-preview 預覽版模型,透過上下文壓縮蒸餾技術,解決傳統檢索只鎖定單一答案段落的問題。模型支援 1024 與 2048 維度,具備原生 INT8 量化能力,能在大幅縮減向量儲存 …
Cloudflare 釋出基於 Apache-2.0 授權的開源決策模型 Clef 與 Clef-flash,主打單次前向傳遞即可輸出結構化機率,無須生成自由文字或進行字串解析。本文深入探討 Clef 的架構設計、多模態輸入支援、官方基準測試數據,以及在自動化代理工作流程中的實際應用。
Brood War Bench 以 Freestyle 虛擬機執行《星海爭霸:怒火燎原》對戰,觀察不同模型與推理設定在即時策略環境中的表現。
小米發布全新機器人基礎模型 Xiaomi-Robotics-1 (XR-1),透過兩階段訓練法與超過 10 萬小時的真實資料,展現卓越的移動操作與環境適應能力,並於多項模擬基準測試中勇奪第一。
PerceptionBench 是 Kimi 團隊推出的新一代 AI 視覺評測工具,專門測試多模態模型的原子感知能力。測試結果顯示,即使是 GPT、Kimi、Claude 等頂尖模型,在純視覺辨識任務中的準確率仍不到 60%,揭露 AI 仍存在計數、空間辨識、OCR 與物件辨識等關鍵弱點。
隨著大語言模型在指令執行與工具調用上取得突破,我們距離真正的「專屬虛擬管家」還有多遠?本文深入解析最新發布的 VitaBench 2.0 評測基準,帶您了解 AI 模型在面對真實世界中零碎的長期交互、動態偏好演化以及主動澄清需求時,所面臨的技術瓶頸。研究更揭露了一個反直覺的真相:幫 AI …
AI 生成圖片的好壞總是很主觀?Qwen 團隊開源了 Qwen-Image-Bench 與基於 Qwen3.6-27B 的 AI 裁判 Q-Judger。本文帶您深入解析其思維鏈運作原理、5 大細緻評分維度,看它如何給出精準的 JSON 結構化評分。
當大型語言模型開始挑戰「視覺程式碼」,誰才是真正的贏家?本文深入解析 Claude Sonnet 4.5、GPT-5.1、Gemini 3.0 等 9 款頂尖 AI 模型的 SVG 生成評測,探討這些模型在 30 個創意提示詞下的表現,並分析這對開發者與設計師意味著什麼。
© 2026 Communeify. All rights reserved.