AI 日報|OpenAI 調降 GPT-5.6 Sol API 價格;Vercel 資料顯示開源權重 Token 佔比突破 62%;NVIDIA AVO 代理在 ARC-AGI-3 拿下滿分
模型發布/更新
Gemini 3.7 Flash — Google DeepMind
- 一言以蔽之:Google 宣佈 Gemini 3.7 Flash 在上線首週打破歷史成長紀錄,成為增長最快的模型,並在 ARC-AGI 基準測試中交出亮眼成績。
- 核心亮點:
- 成長速度創新高:首週使用量與開發者採用率打破 Gemini 歷代模型的成長紀錄,全面整合至 Google 搜尋與 Gemini App 中。
- ARC-AGI 頂級表現:在 ARC-AGI-1 獲得 95.5%、ARC-AGI-2 獲得 84.6% 的高分,且每任務成本僅需 0.12 至 0.25 美元,兼具高效能與經濟性。
- 技術規格:輕量高效架構 / 支援搜尋與 Gemini App 整合 / ARC-AGI-2 84.6%
- 傳送門:
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet. Great to see the huge excitement from our developer community! Now running in Search and @Geminiapp too. https://t.co/IPbBu5Jdto
— Sundar Pichai (@sundarpichai) August 22, 2026
產品發布/更新
GPT-5.6 Sol API 價格調降超 20% — OpenAI
- 更新內容:
- 大規模降價回饋:OpenAI 宣佈在未來 3 個月內,將前沿模型 GPT-5.6 Sol 的 API 呼叫與額度價格調降超過 20%。
- 推動生態普及:旨在降低開發者建構複雜 AI Agent 與應用的門檻,持續在模型效能與運算效率之間取得平衡。
- 適用人群:AI 應用開發者 / 企業級系統架構師 / 創業者
- 體驗通道:
As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months. pic.twitter.com/UoTb3hcB2t
— OpenAI (@OpenAI) August 21, 2026
SGLang 權重快取守護行程 (Weight Cache Daemon) — 螞蟻百靈 (Ant Group)
- 更新內容:
- 極速載入突破:針對 SGLang 推理框架推出 Weight Cache Daemon,在 Ling-2.6-1T FP8 模型上將權過載入時間縮短至約 0.63 秒,較傳統磁碟載入快約 780 倍。
- 大幅縮短冷啟動:將引擎總啟動時間從原本的 8.8 分鐘大幅壓縮至約 0.53 分鐘,顯著提升大模型叢集的營運與除錯效率。
- 適用人群:大模型基礎設施工程師 / 算力叢集運維專家
- 體驗通道:
Today, we’re introducing the Weight Cache Daemon for SGLang. 🚀
— Ant Ling (@AntLingAGI) August 22, 2026
On Ling-2.6-1T FP8, it reduced weight loading to ~0.63s, up to ~780× faster than disk loading, and cut total engine startup from 8.8 minutes to ~0.53 minutes.
Here’s how it works. pic.twitter.com/zzwR2hFZwf
產業動態
Vercel AI Gateway 資料顯示:開源權重 Token 佔比首次突破 62%
- 事件概述:根據 Vercel AI Gateway 發布的最新統計資料,平臺上的開源權重模型 Token 消耗佔比達到 62%,相較兩個月前的 28.4% 出現跳躍式增長。
- 影響分析:反映出隨著開發者工具鏈、CLI 與 SDK 逐漸走向模型無關 (Model-agnostic),企業與開發者在實際生產環境中正加速轉向更具價效比與自主性的開源模型,閉源模型的市佔面臨強烈挑戰。
- 新聞連結:
Today's a record day for open weight share of tokens on Vercel AI Gateway.
— Guillermo Rauch (@rauchg) August 22, 2026
Aug 22 (today)
🟦 Open: 62%
🟨 Closed: 38%
Jun 24 (~2 months ago)
🟦 Open: 28.4%
🟨 Closed: 71.6%
This is very likely just the start, because enterprise adoption is still early, and harnesses, CLIs,… pic.twitter.com/xoBpdHnrAa
Google DeepMind 攜手 Fenris Creations 深化遊戲 AI 研究
- 事件概述:Google DeepMind 宣佈與 Fenris Creations 達成合作,將其在遊戲領域長達 15 年的 AI 研究成果(從 Atari 到 EVE Online 等專案)進一步拓展至複雜虛擬世界的 AI Agent 模擬中。
- 影響分析:遊戲環境因具備高度複雜性、動態對抗與不完美資訊,被視為訓練通用 AI Agent 的最佳試驗場,此項合作將加速具身智慧與長期規劃演進。
- 新聞連結:DeepMind 官方部落格
前 DeepMind 校友創立 Inherent 獲得 5000 萬美元種子輪融資並推出 AI 研究員 Faraday
- 事件概述:由倫敦 DeepMind 前校友創立的 AI 新創 Inherent 宣佈走出隱身模式,獲得 5,000 萬美元種子輪融資,並推出基於 270 億引數 Qwen 3.6 訓練的專用研究 AI Agent Faraday。
- 影響分析:Inherent 宣稱 Faraday 在獨立復現已發表科學論文結論的任務上,超越了 Claude Opus 4.8 與 GPT-5.5,突顯透過強化學習培養「研究品味」的專用科學 Agent 正成為資本追逐的新焦點。
- 新聞連結:TechCrunch 報導
論文研究
AVO Agent 在 ARC-AGI-3 公開集取得 100 分滿分 — NVIDIA
- 研究動機:為了驗證通用目的架構在處理長週期、複雜動態推理任務時的極限,NVIDIA 團隊建構了專屬的編碼與推理框架。
- 核心創新:NVIDIA 開發的 AVO Agent 框架透過深度最佳化 CUDA GPU 核心與自適應推理迴圈,能夠自主執行、最佳化並自我訓練模型。
- 研究成果:在 ARC-AGI-3 的 25 個公開遊戲中取得 100% 的完美分數,成功解開全部 183 個關卡,展現前沿級通用 AI Agent 在長週期任務上的強大潛力。
- 論文地址:NVIDIA 開發者部落格
多代理辯論如何提升 AI AI Agent 決策確定性 — 史丹福大學 (Stanford University)
- 研究動機:單一 LLM 在面對複雜決策或政治、數學等開放式問題時常伴隨幻覺或不確定性,研究團隊探討群體互動是否能有效改善推理品質。
- 核心創新:執行超過 10,000 個由 32 種不同人格特質 AI Agent 組成的小型社群模擬,經過 8 輪資訊交流來觀察觀點漂移與共識形成機制。
- 研究成果:發現互動能有效校正錯誤多數派轉向正確答案;但在政治等議題上會出現明顯的政治傾向偏移,研究建議部署多代理系統時必須即時追蹤群體漂移方向。
- 論文地址:
New Stanford paper found that letting AI agents argue with each other and makes them more certain.
— Rohan Paul (@rohanpaul_ai) August 22, 2026
The team ran over 10,000 small communities of language-model agents.
Letting agents discuss a math problem moves the group toward the right answer.
Each had 32 agents with… pic.twitter.com/Xux0aAWcAo
Task Model Induction (TMI):將螢幕錄製轉化為高精度可複用技能 — 研究團隊
- 研究動機:傳統 AI Agent 需要透過繁瑣的手動編寫工具或提示詞來定義工作流,如何直接從人類的實際操作中高效萃取可複用技能一直是業界難題。
- 核心創新:提出 Task Model Induction (TMI) 方法,能直接從原始螢幕錄製與滑鼠鍵盤操作事件中,提取出高度結構化的符號化任務模型。
- 研究成果:在任務分組與真實標註的一致性高達 0.974,重建了 74.9% 的執行步驟,提取出的技能在保留任務上的準確度較傳統工作流歸納基準提升 30.0%。
- 論文地址:
This is one of the most effective ways to improve your agentic workflows.
— DAIR.AI (@dair_ai) August 22, 2026
If you are building computer-use agents, this one is worth your time.
Task Model Induction takes a raw recording of someone working, just screenshots and mouse and keyboard events, and turns it into a… pic.twitter.com/fzZnEk4OSe
其他分享
銀河通用人形機器人實現全球首次自主網球對打「AstraTennis 時刻」
- 內容簡介:銀河通用的人形機器人在北京國家速滑館的網球場上,與人類頂尖網球選手完成了一場高品質的公開直播對打。機器人憑藉「銀河星腦」AstraBrain 底座,在高速、強對抗的實體環境中自主判斷來球落點,流暢完成正手、反手、網前截擊甚至摔倒後自主起身,標誌著物理 AI 在即時動態對抗場景中的重大突破。
- 傳送門:微信公眾號報導



