AI 日報|智譜 GLM-5.3 發布、Anthropic 多項 API GA、NVIDIA 60 億美元收購 Poolside 模型工廠
模型發布/更新
GLM-5.3 (Max) — 智譜 AI (Z.ai)
- 一言以蔽之:專為程式碼開發與網路安全防禦打造,顯著提升 Code Arena WebDev 效能邊界。
- 核心亮點:
- 程式碼能力躍升:在 Code Arena: WebDev 基準測試中獲得 1,597 分,登頂開源模型第二名(總榜第八名),推論表現媲美 Qwen3.8 (Max)。
- 深度後訓練:以 743B 基礎模型進行後訓練,大幅強化 AI Agent 協作與網路安全防禦能力。
- 技術規格:743B 基礎模型後訓練 / 閉源 API(預計開源權重)/ API 價格每百萬 Token 為 3.65 美元
- 傳送門:Z.ai 官方技術部落格
Muse Spark 1.2 & Muse Code (Beta) — Meta AI
- 一言以蔽之:引進空間智慧與強大多模態能力,專為機器人操控與長流程程式碼開發設計。
- 核心亮點:
- 多模態推論增強:能將視覺觀察直接轉化為可執行程式碼或物理動作,在 Agent Arena 取得 net improvement +2.1% 的提升。
- 機器人操控大腦:推出專用變體作為機器人控制中樞,能規劃並執行雙手機器人的多步驟任務(如分揀桌上物品)。
- 技術規格:多模態前沿模型 / Agent Arena Chat 榜第 15 名 / 閉源研究展示
- 傳送門:Meta AI 官方多模態評測頁面
Tenet 法律專用模型 — Harvey & Fireworks AI
- 一言以蔽之:基於 Kimi K3 進行深度後訓練的法律領域大模型,大幅提升複雜法律工作推論能力。
- 核心亮點:
- 領域高度最佳化:結合公共法律資料、合成資料與專家模擬資料,Pass Rate 在 LAB 合約評測中提升 22%。
- 權威測試表現出色:在 Corporate Law 與 Redline Bench 等多項專業法律 AI 基準測試中均取得 SOTA 或第二名的成績。
- 技術規格:基於 Kimi K3 後訓練 / 閉源專業模型 / 由 Fireworks AI 提供訓練支援
- 傳送門:Harvey 官方部落格
產品發布/更新
Claude Platform 三大 API GA 與全新瀏覽器操作工具 — Anthropic
- 更新內容:Computer Use、Skills API 與 Files API 正式在 Claude Platform 全面可用(GA)。Computer Use 新增瀏覽器操作工具,單次互動可執行多項動作,使任務輪數減少 20%-40%;Files API 支援檔案過期機制,並將 Rate Limit 提升 5 倍至 500 RPM,提供每機構 1 TB 儲存空間。
- 適用人群:開發者 / 企業 AI Agent 架構師
- 體驗通道:Anthropic 官方部落格
Mistral Agentic Search 多步檢索功能 — Mistral AI
- 更新內容:推出 Agentic Search,透過包含
search、open、navigate、read與grep5 種工具的多步檢索迴圈,讓 AI Agent 能在長篇檔案與多個資料源中精確定位、驗證並整合資訊,解決傳統 RAG 檢索精度不足的問題。 - 適用人群:企業知識庫開發者 / AI 搜尋與研發人員
- 體驗通道:Mistral 官方新聞發布
ChatGPT Apple Messages 整合外掛 — OpenAI
- 更新內容:OpenAI 為 macOS 版 ChatGPT Work 與 Codex 推出 Apple Messages(訊息)外掛。使用者可授權 ChatGPT 搜尋簡訊記錄、整理對話摘要,並直接代為起草與傳送訊息,所有處理皆於本地端執行。
- 適用人群:macOS 使用者 / 辦公族 / 個人效率追求者
- 體驗通道:
Everyday conversations just got easier with the new Apple Messages plugin.
— ChatGPT (@ChatGPT) August 20, 2026
Search messages, catch up on conversations, draft and send replies—all with ChatGPT on your Mac.
Now available in ChatGPT Work and Codex on desktop. pic.twitter.com/nicfZMuxZc
GPT-Image-2 API 透明背景生成預覽 — OpenAI
- 更新內容:OpenAI 開放 GPT-Image-2 API 的透明背景生成預覽功能(Preview),開發者可直接生成具備透明通道的影畫素材,方便設計師與自動化工作流直接套用到各類背景中。
- 適用人群:設計師 / 視覺 AI 開發者 / 行銷團隊
- 體驗通道:
Transparent backgrounds are now available in preview for GPT-Image-2 in the API.
— OpenAI Developers (@OpenAIDevs) August 20, 2026
Generate reusable assets you can place on any background—for product imagery, graphic design, website mockups, and marketing campaigns. pic.twitter.com/yRhBIYh8uP
Google Antigravity 企業級擴充套件與 IDE 外掛 — Google Cloud
- 更新內容:Google 宣佈 Antigravity 正式納入 Gemini Enterprise 訂閱,並提供包含 VS Code 在內的主流 IDE 擴充外掛。同時提供企業級管理控制檯與共享 Token 額度池,降低企業部署程式碼 AI Agent 的門檻。
- 適用人群:企業 IT 管理員 / 軟體工程師
- 體驗通道:Google Cloud 官方部落格
Claude Academy 免費 AI 學習平臺 — Anthropic
- 更新內容:Anthropic 正式推出 Claude Academy,借鑑其內部員工訓練方法(包含 4D AI Fluency 框架),提供從基礎入門到進階 Agent 開發的免費課程與教學,幫助使用者與團隊安全、有效率地掌握 AI 工具。
- 適用人群:AI 初學者 / 企業培訓師 / 開發者
- 體驗通道:Claude Academy 官方網站
Notion Agent 團隊技能 (Team Skills) — Notion
- 更新內容:Notion Agent 現已支援團隊技能(Skills),系統能依據對話自動選用對應的團隊標準作業流程(SOP)。此外,這些技能可直接匯出為
SKILL.md,無縫同步至 Claude Code、Codex、Cursor、Gemini 與 Grok 等本地端工具。 - 適用人群:團隊主管 / 專案管理者 / 知識庫維護者
- 體驗通道:
Skills for your whole team are here.
— Notion (@NotionHQ) August 20, 2026
Most agents start from scratch. Skills teach them how your team already works.
Ask your Notion Agent to turn your team’s best work into a skill… then share it, let your agent load it automatically, or use it with your local agents. pic.twitter.com/bw2igoLRNY
產業動態
NVIDIA 以 60 億美元收購 Poolside 模型工廠業務
- 事件概述:據 Latent Space 等訊息源透露,NVIDIA 已完成對 AI 新創 Poolside 旗下「模型工廠(Model Factory)」業務的收購,交易金額高達 60 億美元。大量 Poolside 研究人員將加入 NVIDIA,而 Poolside 創辦人則留守並計畫轉型為 Neocloud 算力提供商。
- 影響分析:這顯示硬體巨頭 NVIDIA 正在加速深化縱向整合,直接收購頂尖模型訓練團隊與流水線,以強化自身軟體生態與專用模型的研發壁壘。
- 新聞連結:
proud that @vibhuuuus and i did the most recent pod with @eisokant on why NVIDIA just paid him $6B to buy the incredible model factory that is pumping out Thinky-beating models (actually not exaggeration, look at the numbers)
— swyx (@swyx) August 20, 2026
tune in / subscribe / whatever… https://t.co/rbdKxywB0r pic.twitter.com/UGIOGC19SK
OpenAI 部署首批 NVIDIA Vera Rubin 算力機櫃進行下一代模型預訓練
- 事件概述:OpenAI 基礎設施團隊宣佈,首批 NVIDIA Vera Rubin 伺服器機櫃已正式抵達並部署至訓練機房,目前已全面投入 OpenAI 下一代前沿 LLM 的預訓練堆疊(Pre-training Stack)中。
- 影響分析:象徵著 OpenAI 與 NVIDIA 合作夥伴關係的重大里程碑,下一代架構的硬體算力正式上線,將為未來的 GPT-6 或更高等級前沿模型提供強大支撐。
- 新聞連結:
huge milestone in our partnership with NVIDIA https://t.co/qaV1devSRZ
— Greg Brockman (@gdb) August 20, 2026
蘋果反擊 OpenAI:提交新法律訴狀指控大規模商業機密竊取
- 事件概述:蘋果公司向美國地區法院提交最新訴訟回應,強烈反對 OpenAI 駁回訴訟的請求。蘋果指控 OpenAI 透過挖角其前員工劉暢(Chang Liu)等途徑,利用漏洞非法下載數十份機密硬體檔案、CAD 圖紙及供應商細節。
- 影響分析:隨著科技巨頭在端側 AI 與硬體產品領域的激烈交鋒,人才競爭已轉化為法律與商業機密的攻防戰,兩家公司在技術合作與競爭上的關係將更加複雜。
- 新聞連結:
Apple pushes back against OpenAI’s attempt to dismiss the lawsuit, again alleging widespread trade secret misappropriation.
— Rohan Paul (@rohanpaul_ai) August 20, 2026
Apple filed this new response on August 19, 2026, in the U.S. District Court
Basically says says OpenAI’s dismissal bid sidesteps detailed claims… pic.twitter.com/E485u2HTH9
論文研究
Agent 外殼層持續學習與外殼層遺忘問題研究 — ArXiv 2608.19013
- 研究動機:現代 AI Agent 的經驗積累主要存在於外殼層(Harness,如 Prompt、記憶、工具與路由規則)而非模型權重。更新外殼層元件常導致先前的穩定行為破裂(即「外殼層遺忘」)。
- 核心創新:提出了「受保護外殼層演進(Guarded Harness Evolution)」機制,將候選外殼層的提出與提交分離,經由持續評估器驗證改善度與歷史保留率後才進行提交。
- 研究成果:在文字推論、多模態感知與開放世界互動等任務中,外殼層效能相對提升超過 10%。
- 論文地址:ArXiv:2608.19013 論文頁面
記憶型自我改進 Agent 的效能增益重新評估 — DARAI Research
- 研究動機:檢驗當前熱門的「基於記憶進行自我改進」的 AI Agent,其宣稱的效能提升是否真實可靠。
- 核心創新:補充了先前研究忽視的兩項評測標準:多次執行測量方差,以及打亂任務執行順序。
- 研究成果:實驗表明,許多先前報告的增益主要源於評測雜訊與任務順序帶來的隱性課程學習;當打亂順序後效能顯著下降,顯示記憶型自我改進機制仍存在虛高現象。
- 論文地址:
Finally a good paper testing whether memory-based self-improving agents actually improve.
— DAIR.AI (@dair_ai) August 20, 2026
The re-evaluation adds two things prior work skipped, multiple runs to measure variance and randomly shuffled task orders.
Both hurt.
Agent evaluation is already noisy on multi-step… pic.twitter.com/ACSukALzZY
其他分享
Bun 1.4 發布:重構 Rust 底層並引進 Bun.WebView 瀏覽器自動化
- 內容簡介:JavaScript 執行環境 Bun 發布 1.4 巨量更新,將底層從 Zig 完全重構為 Rust,修復破 2,900 個 Issue 並大幅降低 CPU 與記憶體佔用。最受關注的全新 API
Bun.WebView提供了原生等級的瀏覽器自動化能力,能直接控制 macOS WebKit 或本地 Chromium。 - 傳送門:Simon Willison 技術專文
AlloyDB ScaNN 實現 100 億向量規模超低延遲搜尋
- 內容簡介:Google Cloud 發表 AlloyDB ScaNN 向量索引的最新突破,透過全新的「四層樹(Four-level Tree)」架構,將查詢複雜度從 $O(N^{1/2})$ 降至 $O(N^{1/4})$。在 100 億向量規模下,達到 p95 延遲小於 51 毫秒與 95% 的召回率,大幅突破大資料量下 AI Agent 向量檢索的瓶頸。
- 傳送門:Google Cloud 官方技術部落格



