news

AI 日報|OpenAI 調降 GPT-5.6 Sol API 價格;Vercel 資料顯示開源權重 Token 佔比突破 62%;NVIDIA AVO 代理在 ARC-AGI-3 拿下滿分

August 23, 2026
Updated Aug 23
3 min read
openai
AI 日報|OpenAI 調降 GP
vercel
PI 價格;Vercel 資料顯示開
nvidia
破 62%;NVIDIA AVO 代
gemini
發布/更新 Gemini 3.7 F
google
ash — Google DeepM
deepmind
oogle DeepMind 一言以蔽之
news
AI 日報|OpenAI 調降 GPT-5.6 Sol API 價格;Vercel 資料顯示開源權重 Token 佔比突破 62%;NVIDIA AVO 代理在 ARC-AGI-3 拿下滿分
2026-08-23

AI 日報|OpenAI 調降 GPT-5.6 Sol API 價格;Vercel 資料顯示開源權重 Token 佔比突破 62%;NVIDIA AVO 代理在 ARC-AGI-3 拿下滿分


模型發布/更新

Gemini 3.7 Flash — Google DeepMind

  • 一言以蔽之:Google 宣佈 Gemini 3.7 Flash 在上線首週打破歷史成長紀錄,成為增長最快的模型,並在 ARC-AGI 基準測試中交出亮眼成績。
  • 核心亮點
    • 成長速度創新高:首週使用量與開發者採用率打破 Gemini 歷代模型的成長紀錄,全面整合至 Google 搜尋與 Gemini App 中。
    • ARC-AGI 頂級表現:在 ARC-AGI-1 獲得 95.5%、ARC-AGI-2 獲得 84.6% 的高分,且每任務成本僅需 0.12 至 0.25 美元,兼具高效能與經濟性。
  • 技術規格:輕量高效架構 / 支援搜尋與 Gemini App 整合 / ARC-AGI-2 84.6%
  • 傳送門

產品發布/更新

GPT-5.6 Sol API 價格調降超 20% — OpenAI

  • 更新內容
    • 大規模降價回饋:OpenAI 宣佈在未來 3 個月內,將前沿模型 GPT-5.6 Sol 的 API 呼叫與額度價格調降超過 20%。
    • 推動生態普及:旨在降低開發者建構複雜 AI Agent 與應用的門檻,持續在模型效能與運算效率之間取得平衡。
  • 適用人群:AI 應用開發者 / 企業級系統架構師 / 創業者
  • 體驗通道

SGLang 權重快取守護行程 (Weight Cache Daemon) — 螞蟻百靈 (Ant Group)

  • 更新內容
    • 極速載入突破:針對 SGLang 推理框架推出 Weight Cache Daemon,在 Ling-2.6-1T FP8 模型上將權過載入時間縮短至約 0.63 秒,較傳統磁碟載入快約 780 倍。
    • 大幅縮短冷啟動:將引擎總啟動時間從原本的 8.8 分鐘大幅壓縮至約 0.53 分鐘,顯著提升大模型叢集的營運與除錯效率。
  • 適用人群:大模型基礎設施工程師 / 算力叢集運維專家
  • 體驗通道

產業動態

Vercel AI Gateway 資料顯示:開源權重 Token 佔比首次突破 62%

  • 事件概述:根據 Vercel AI Gateway 發布的最新統計資料,平臺上的開源權重模型 Token 消耗佔比達到 62%,相較兩個月前的 28.4% 出現跳躍式增長。
  • 影響分析:反映出隨著開發者工具鏈、CLI 與 SDK 逐漸走向模型無關 (Model-agnostic),企業與開發者在實際生產環境中正加速轉向更具價效比與自主性的開源模型,閉源模型的市佔面臨強烈挑戰。
  • 新聞連結

Google DeepMind 攜手 Fenris Creations 深化遊戲 AI 研究

  • 事件概述:Google DeepMind 宣佈與 Fenris Creations 達成合作,將其在遊戲領域長達 15 年的 AI 研究成果(從 Atari 到 EVE Online 等專案)進一步拓展至複雜虛擬世界的 AI Agent 模擬中。
  • 影響分析:遊戲環境因具備高度複雜性、動態對抗與不完美資訊,被視為訓練通用 AI Agent 的最佳試驗場,此項合作將加速具身智慧與長期規劃演進。
  • 新聞連結DeepMind 官方部落格

前 DeepMind 校友創立 Inherent 獲得 5000 萬美元種子輪融資並推出 AI 研究員 Faraday

  • 事件概述:由倫敦 DeepMind 前校友創立的 AI 新創 Inherent 宣佈走出隱身模式,獲得 5,000 萬美元種子輪融資,並推出基於 270 億引數 Qwen 3.6 訓練的專用研究 AI Agent Faraday。
  • 影響分析:Inherent 宣稱 Faraday 在獨立復現已發表科學論文結論的任務上,超越了 Claude Opus 4.8 與 GPT-5.5,突顯透過強化學習培養「研究品味」的專用科學 Agent 正成為資本追逐的新焦點。
  • 新聞連結TechCrunch 報導

論文研究

AVO Agent 在 ARC-AGI-3 公開集取得 100 分滿分 — NVIDIA

  • 研究動機:為了驗證通用目的架構在處理長週期、複雜動態推理任務時的極限,NVIDIA 團隊建構了專屬的編碼與推理框架。
  • 核心創新:NVIDIA 開發的 AVO Agent 框架透過深度最佳化 CUDA GPU 核心與自適應推理迴圈,能夠自主執行、最佳化並自我訓練模型。
  • 研究成果:在 ARC-AGI-3 的 25 個公開遊戲中取得 100% 的完美分數,成功解開全部 183 個關卡,展現前沿級通用 AI Agent 在長週期任務上的強大潛力。
  • 論文地址NVIDIA 開發者部落格

多代理辯論如何提升 AI AI Agent 決策確定性 — 史丹福大學 (Stanford University)

  • 研究動機:單一 LLM 在面對複雜決策或政治、數學等開放式問題時常伴隨幻覺或不確定性,研究團隊探討群體互動是否能有效改善推理品質。
  • 核心創新:執行超過 10,000 個由 32 種不同人格特質 AI Agent 組成的小型社群模擬,經過 8 輪資訊交流來觀察觀點漂移與共識形成機制。
  • 研究成果:發現互動能有效校正錯誤多數派轉向正確答案;但在政治等議題上會出現明顯的政治傾向偏移,研究建議部署多代理系統時必須即時追蹤群體漂移方向。
  • 論文地址

Task Model Induction (TMI):將螢幕錄製轉化為高精度可複用技能 — 研究團隊

  • 研究動機:傳統 AI Agent 需要透過繁瑣的手動編寫工具或提示詞來定義工作流,如何直接從人類的實際操作中高效萃取可複用技能一直是業界難題。
  • 核心創新:提出 Task Model Induction (TMI) 方法,能直接從原始螢幕錄製與滑鼠鍵盤操作事件中,提取出高度結構化的符號化任務模型。
  • 研究成果:在任務分組與真實標註的一致性高達 0.974,重建了 74.9% 的執行步驟,提取出的技能在保留任務上的準確度較傳統工作流歸納基準提升 30.0%。
  • 論文地址

其他分享

銀河通用人形機器人實現全球首次自主網球對打「AstraTennis 時刻」

  • 內容簡介:銀河通用的人形機器人在北京國家速滑館的網球場上,與人類頂尖網球選手完成了一場高品質的公開直播對打。機器人憑藉「銀河星腦」AstraBrain 底座,在高速、強對抗的實體環境中自主判斷來球落點,流暢完成正手、反手、網前截擊甚至摔倒後自主起身,標誌著物理 AI 在即時動態對抗場景中的重大突破。
  • 傳送門微信公眾號報導
分享至:
Featured Partners

© 2026 Communeify. All rights reserved.