AI 日報|OpenAI GPT-6 Astra 重磅登場!NVIDIA 敲定 129 億美元收購 Hugging Face
模型發布/更新
GPT-6 Astra — OpenAI
- 一言以蔽之:OpenAI 正式推出被內部視為「跨入 AGI 時代」的全新旗艦模型 GPT-6 Astra,專精長程自主電腦操作、科學發現與深層符號推理。
- 核心亮點:
- ARC-AGI 3 接近飽和:在 ARC-AGI 3 評測中,透過 Provider Adapter 架構取得 99.9%(標準測試 62.7%~66%),在 96% 的關卡中探索步數少於人類中位數;在 OSWorld 2.0 上單一長任務耗時從 75 分鐘腰斬至 40 分鐘。
- 符號世界建模與科研躍升:在 FrontierMath Tier 4 達到 97.6%~98%、ExploitBench 獲 100%;支援在上下文即時生成領域速記語法(DSL)壓縮狀態,並能直接操作 KiCad、Blender 與 Unreal Engine 5 完成複雜 3D 與工程設計。
- 技術規格:1.05M Context Window / 128k 最大輸出 / 閉源商用(API 輸入 $10、輸出 $50 每百萬 Token,對標 Claude Fable 5.1)
- 傳送門:Simon Willison 深度整理
WeatherNext 3 — Google DeepMind & Google Research
- 一言以蔽之:DeepMind 發表全球天氣預報模型 WeatherNext 3,解析度提升約 5 倍並實現每小時高頻動態更新。
- 核心亮點:
- 全球降水預報誤差銳減 50%:經 Brightband 獨立即時評測,降水預測誤差大幅降低達 50%,顯著改善過去極端風暴邊界誤判與模糊預估問題。
- 深入消費端與科研雲端:直接整合至 Google 搜尋、Gemini、Google 地圖,並透過 BigQuery 與 Earth Engine 全面開放給研究人員與企業存取。
- 技術規格:高解析度全球氣象模型 / 支援即時觀測同化 / 整合至 Google Cloud 與 Earth Engine
- 傳送門:Google DeepMind 官方部落格
K2 Horizon 模型家族 (0.9B 至 375B-A23B) — IFM
- 一言以蔽之:IFM 全面開源包含 6 款尺寸的 K2 Horizon 系列模型,並同步釋出完整的預訓練與微調生命週期資料。
- 核心亮點:
- 全尺寸覆蓋與同級 SOTA:包含 0.9B、3.7B、7B、32B、36B-A4B 與 375B-A23B,小引數量級在端側基準測試中均取得同級最高分。
- MoVA 稀疏注意力架構:其中 36B-A4B 採用新型稀疏注意力架構(MoVA),在超長文字推理與推論吞吐量間達到極佳平衡。
- 技術規格:0.9B ~ 375B-A23B / Apache 2.0 開源協議 / 提供完整訓練日誌與權重
- 傳送門:IFM 官方技術發布頁
MAI-Transcribe 2 — Microsoft
- 一言以蔽之:微軟推出全新語音辨識模型 MAI-Transcribe 2,速度達到 GPT-Transcribe 的 10 倍、Gemini 3.5 的 5 倍。
- 核心亮點:
- 登頂 FLEURS 基準:支援 60 種語言自動識別、多語言程式碼混雜切換(Code Switching)、說話者分離(Speaker Diarization)與詞級時間戳標記。
- 極致價效比邊界:在 Artificial Analysis 的準確率-延遲性帕累託前沿名列第一,具備業界極具競爭力的 API 呼叫定價。
- 技術規格:多語言專用語音模型 / 登陸 Azure Foundry 與 OpenRouter / 極低延遲架構
- 傳送門:
Fastest. Cheapest. Best. ... MAI-Transcribe-2
— Mustafa Suleyman (@mustafasuleyman) September 3, 2026
10x faster than GPT-Transcribe. 5x faster than Gemini 3.5
#1 on the Artificial Analysis accuracy-latency Pareto frontier
Priced at the lowest on the market.
Truly fantastic work from the team! Try it out below. pic.twitter.com/0W6NgJY33Y
產品發布/更新
Grok Bot for Enterprise 企業版 — xAI
- 更新內容:xAI 推出專為持久化 AI Agent 打造的 Grok Bot 企業版。Bot 擁有持久身份、獨立記憶、專屬沙箱電腦與工具鏈,並支援工作狀態視覺化呈現(工作、等待、思考、隨時手動接管)。即日起開放 Grok 與 Cursor 企業使用者兩週全組織免費試用。
- 適用人群:[企業流程自動化團隊 / Cursor 企業版使用者 / 數位轉型架構師]
- 體驗通道:xAI 官方新聞稿
Cloudflare Managed Defense + OpenAI Daybreak 漏洞自動挖掘與修復 — Cloudflare
- 更新內容:Cloudflare 推出 Vulnerability Discovery and Remediation 邀請制服務,深度整合 OpenAI GPT-5.6 Cyber 等 Daybreak 安全模型。系統可自主對授權程式碼庫進行偵察與漏洞挖掘,並在產生修復補丁前完成自動驗證,開發者可一鍵審查並決定是否上線。
- 適用人群:[DevSecOps 工程師 / 雲端安全架構師 / 企業資安團隊]
- 體驗通道:Cloudflare 官方技術部落格
ant CLI 宣告式 Agent 資源管理 (ant apply) — Anthropic
- 更新內容:Anthropic 於 ant CLI 中新增
ant apply指令。開發者可透過 Git 程式碼庫以宣告式檔案集中定義 Claude Managed Agent 的環境、技能(Skills)、記憶儲存庫與部署組態,並透過單一指令使 API 雲端資源與本地組態保持同步。 - 適用人群:[AI Agent 開發者 / Platform 基礎架構工程師 / 自動化工作流團隊]
- 體驗通道:
We've added `ant apply` to the ant CLI.
— ClaudeDevs (@ClaudeDevs) September 3, 2026
Now you can declare Claude Managed Agent environments, agents, skills, memory stores, and deployments as files in your repository and keep the API's resources in sync with them using `ant apply`.
Docs: https://t.co/qQchmDjTmm pic.twitter.com/7hX3OV3h29
Extract Turbo 疾速檔案抽取引擎 — LlamaIndex
- 更新內容:LlamaIndex 發表基於視覺語言模型(VLM)的檔案抽取模式 Extract Turbo。抽取速度較現有方案提升 3 至 5 倍(單頁中位數延遲僅 3.7 秒),並採用平行頁面處理技術,確保多頁大型檔案的處理延遲曲線維持平穩。
- 適用人群:[RAG 開發者 / 企業知識庫工程師 / 資料處理管線團隊]
- 體驗通道:
Today, we're excited to launch Extract Turbo ⚡️ - the fastest VLM-powered document extraction solution.
— Jerry Liu (@jerryjliu0) September 3, 2026
It is 3-5x faster than all other comparable OCR solutions, including our other LlamaParse tiers, at equivalent or higher accuracy. https://t.co/Xodvd6ppWJ pic.twitter.com/VnosXou7Tq
Gemini Live 深度整合 Google Workspace 語音助理 — Google
- 更新內容:Gemini Live 正式加入 Google Workspace 連線能力。使用者可透過自然語音對話即時檢索 Gmail 收件匣重要信件、在 Google Keep 中整理靈感與待辦清單,或在 Google Docs 中以語音協作即時生成檔案。
- 適用人群:[行動辦公族 / 商務人士 / Google Workspace 訂閱使用者]
- 體驗通道:Google 官方產品部落格
Bolt.new Visual Edits 畫布視覺化編輯 — StackBlitz
- 更新內容:Bolt.new 上線 Visual Edits 畫布編輯功能。使用者在預覽生成的 Web 應用時,可直接透過滑鼠選取文字、導覽列或按鈕等元素進行所見即所得的即時樣式調整,大幅降低依賴自然語言 Prompt 反覆除錯前端介面的成本。
- 適用人群:[前端工程師 / 產品設計師 / Vibe Coding 開發者]
- 體驗通道:
Visual Edits are now live in Bolt.
— bolt.new (@boltdotnew) September 3, 2026
Sometimes prompting isn’t the right tool. Now you can make edits directly on the canvas.
Here's how it works 👇 pic.twitter.com/mCHf7IwXdY
產業動態
NVIDIA 正式宣佈以 129.3 億美元收購 Hugging Face
- 事件概述:NVIDIA 執行長黃仁勳正式宣佈與 Hugging Face 達成收購協議,交易總金額為 129.303 億美元(含約 119 億美元收購款及 10 億美元員工留任股權激勵),Hugging Face 將維持其獨立開放平臺營運。
- 影響分析:這是 NVIDIA 歷史上第二大收購案。NVIDIA 將其版圖從底層 GPU 硬體與 CUDA 生態系,正式向上延伸至擁有 1,800 萬開發者、300 萬個模型與 50 萬個資料集的開源中心,奠定完整的全棧 AI 護城河。
- 新聞連結:NVIDIA 官方新聞稿
OpenAI 提撥 10 億美元推動「Daybreak for Frontline Defenders」全球網路防禦計畫
- 事件概述:隨著 GPT-6 Astra 在 Preparedness Framework 達到「關鍵級(Critical)」資安能力門檻,OpenAI 宣佈提撥 10 億美元額度,在未來半年內為水電公共設施、電網、地方政府與開源維護者等一線防禦單位提供免費 Daybreak 資安模型算力與培訓支援。
- 影響分析:標誌著 AI 資安正式進入前沿模型自動化攻防階段。在具備自主挖掘未公開漏洞的能力下,頂級實驗室透過補貼防禦端以緩解監管機構對 AI 網路武器化的合規擔憂。
- 新聞連結:OpenAI 官方公告
全球主流 AI 服務同日發生大規模連鎖中斷
- 事件概述:9 月 3 日晚間,ChatGPT、Claude、Codex 與 Grok 等多個頂級 AI 服務在同一時間視窗內陸續出現高錯誤率與服務中斷;xAI 證實係 Memphis 運算中心中斷所致,同時多個平臺亦受上游網路及代理服務波動波及,數小時後均恢復運作。
- 影響分析:凸顯出整個 AI 應用生態高度集中於少數大型運算中心與雲端代理節點的脆弱性,加速推動開發者社群在生產環境中匯入多模型容錯路由與本機開源備援架構。
- 新聞連結:
We are sorry for the issues you may have experienced with Grok following an outage at our Memphis compute center this morning. We’d also like to apologize to our impacted compute partners.
— SpaceXAI (@SpaceXAI) September 3, 2026
All systems have now been restored and are functioning nominally.
論文研究
Language Models Can Control Their Own Attention (Declarative Attention) — KAIST AI & Google DeepMind
- 研究動機:長文字推理與多步驟思維鏈(CoT)生成常帶來龐大的 KV Cache 讀取開銷與無關歷史資訊幹擾,成為推論延遲的主要瓶頸。
- 核心創新:提出「宣告式注意力(Declarative Attention)」機制,使語言模型在生成過程中具備主動宣告並自我調節注意力視野的能力,動態遮蔽無關歷史狀態。
- 研究成果:在顯著降低 KV Cache 記憶體存取頻寬與推論延遲的同時,有效提升了長程複雜邏輯推理的準確度與穩定性。
- 論文地址:
Banger paper from Google DeepMind and colleagues.
— elvis (@omarsar0) September 3, 2026
(bookmark it)
A model reads its entire KV cache on every generated token, even though it ends up attending to a tiny slice of it.
In other words, if you ask about one detail from a 1M-token conversation the global attention… pic.twitter.com/jcZk3XGM7y
Act More, Decide Less: Skill-Guided Adaptive Action Chunking (SPACE) — 研究團隊
- 研究動機:自主 AI Agent 在長流程任務中往往每步都需要呼叫大型語言模型進行決策,導致 Token 成本過高且執行效率低落。
- 核心創新:提出 SPACE 框架,從成功軌跡中歸納出兩級程式化技能,將子技能邊界作為分塊監督訊號,並透過混合強化學習蒸餾出具備自適應動作分塊能力的決策策略。
- 研究成果:在多項長時程 Agent 評測中,成功減少了高達 78.9% 的 LLM 呼叫次數,大幅縮短任務耗時並降低呼叫成本。
- 論文地址:
Brilliant paper on long-horizon agents.
— DAIR.AI (@dair_ai) September 3, 2026
They cut 78.9% of an agent's LLM calls while raising its success rate.
Here is how:
It turns out that ReAct issues one primitive action per model round. That allows frequent replanning, and on long-horizon tasks it spends most of the… pic.twitter.com/37LRSFDJtQ
E-Commerce Bench: Evaluating Long-Horizon Autonomous Business Operations — 阿里通義千問團隊
- 研究動機:現有評測基準多侷限於短程程式設計或問答,缺乏評估 AI Agent 在長達數月至一年的真實商業環境中進行動態博弈與資金運作的能力。
- 核心創新:建構包含 6,886 種商品、576 家供應商(含 152 家詐騙商)的 365 天電商自主營運模擬環境,要求 Agent 從 10 萬人民幣本金起步,全權處理採購、議價、定價、庫存與現金流。
- 研究成果:評測顯示現有前沿模型在長程商業學習上仍面臨巨大挑戰,幾乎無模型能在一年營運中自主學會降低採購成本,揭示出長期自主經營評測中無單一模型全面佔優的現況。
- 論文地址:arXiv:2608.30730 論文連結
其他分享
show-me:讓 AI 優先以結構圖表解釋程式碼的開源 Skill — Humanlayer
- 內容簡介:Humanlayer 開源的
/show-meSkill 成為近期熱門工具。當開發者在終端或 IDE 中向 AI 提問複雜技術問題時,該技能會驅動模型優先輸出最合適的結構圖表(如函式呼叫樹 Call Tree、React 元件樹、Mermaid 時序圖或 Diff 視覺化)代替落落長的文字解說,讓 Code Review 與 PR 說明一目瞭然。 - 傳送門:GitHub - humanlayer/skills
OpenClaw v2026.9.1 發布,原生整合 Mermaid 互動圖表與即時快捷設定 — OpenClaw
- 內容簡介:開源 Agent 控制中樞 OpenClaw 發布 2026.9.1 更新,在 macOS、iOS、Android 及 Web 控制檯中全面支援 Mermaid 區塊原生圖表渲染與放大預覽;新安裝流程更提供自動偵測 Claude Code / Codex 金鑰的極速啟動通道。
- 傳送門:OpenClaw GitHub Releases



