AI日報|Meta開源30B本地端代理、Claude推進數學猜想進展、GPT-5.6-Cyber發布
快訊
模型發布/更新
Muse Glimmer (30B) & Muse Spark 1.2 預告 — Meta Superintelligence Labs
- 一言以蔽之:Meta 重返開源權重領域,釋出專為本地常駐 AI Agent 設計的 30B 多模態模型 Muse Glimmer,並承諾近期開放更強大的 Muse Spark 1.2。
- 核心亮點:
- 極致本地 Agent 效能:30B 密集模型支援 128K+ 上下文,搭配輕量級 DFlash 輔助模型,量化後視訊記憶體佔用小於 20GB,可在消費級 GPU 或 Mac 上實現流暢即時對話。
- 全流程 Agent 任務完成:在 DeepSearch QA、MCP-Atlas 與 SWE-Bench 等測試中展現出色的自主工具呼叫與長流程推理能力。
- 技術規格:30B 引數 / 128K+ Context / 雙採 Apache 2.0 開源授權
- 傳送門:
Introducing Muse Glimmer, an open-weight 30B-parameter model optimized for local, always-on agent workflows.
— AI at Meta (@AIatMeta) August 10, 2026
Muse Glimmer delivers strong performance on key agentic use cases and benchmarks compared with leading models in its size category, and is designed to run entirely on… pic.twitter.com/mI4z91GPnE
GPT-5.6-Cyber — OpenAI
- 一言以蔽之:OpenAI 推出網路安全專用微調模型 GPT-5.6-Cyber,並將其納入升級後的 Daybreak 網路防禦計畫中。
- 核心亮點:
- 實戰級資安漏洞研究:專為授權漏洞研究、攻擊驗證與安全測試設計,已在真實測試中發現 Chrome v8 引擎等知名開源軟體中的未公開漏洞(Zero-day)。
- 分級存取管制:僅提供給透過審核的受信任資安防禦團隊與合作夥伴使用,配備額外監控機制以防濫用。
- 技術規格:閉源專用微調模型 / 託管於 Daybreak Red 平臺
- 傳送門:OpenAI 官方公告
MAI-Image-2.6 — Microsoft AI
- 一言以蔽之:微軟最新影象生成模型 MAI-Image-2.6 登上 Text-to-Image Arena 排行榜第二名,表現顯著超越上一代。
- 核心亮點:
- 競技場成績飛躍:在文生圖競技場取得 1336 分,僅落後榜首 GPT Image 2 (Medium) 45 分,相比上一代 MAI-Image-2.5(第 10 名)實現全方位躍升。
- 全類別能力增強:在 3D 建模影象(登頂第 1)、動漫風、產品商業設計、文字渲染與肖像畫等領域表現突出。
- 技術規格:閉源影象生成模型 / 下週於 Playground 及 Foundry API 開放體驗
- 傳送門:Microsoft AI 官方新聞
Needle2 (45M) — Cactus Compute
- 一言以蔽之:專為邊緣裝置與物聯網設計的 45M 超輕量 AI Agent 模型,執行檔僅 14MB。
- 核心亮點:
- 極致資源佔用:僅需 14MB 執行檔與 28MB 會話記憶體,即可在手機、穿戴式裝置與智慧家居控制晶片上執行。
- 專精結構化輸出:最佳化工具呼叫(Function Calling)與 JSON 結構化資料提取,適合終端邊緣控制。
- 技術規格:45M 引數 / 開源模型權重 / 適用於 ARM 與邊緣硬體
- 傳送門:Needle 專案官網
產品發布/更新
Claude 全線新模型將嵌入隱形文字浮水印 — Anthropic
- 更新內容:Anthropic 宣佈遵守歐盟 AI 法案(EU AI Act)規範,自 2026 年 8 月 2 日起發布的所有新 Claude 模型,均會在生成的文字中嵌入隱形文字浮水印。該浮水印屬於文字本身的特定分詞結構,即便複製貼上或進行部分編輯仍會保留,目前正逐步適配至舊款模型。
- 適用人群:內容創作者 / 企業使用者 / 政策合規團隊
- 體驗通道:
Must be load-bearing. https://t.co/9Jq3gslbx7
— Peter Steinberger 🦞 (@steipete) August 10, 2026
Chrome DevTools Connect for WebStorm — JetBrains
- 更新內容:WebStorm 2026.2.1 內建了 Chrome DevTools CLI 工具技能。AI Coding Agent 不僅能撰寫程式碼,還能直接操作 Chrome 瀏覽器、檢測 DOM 元素與渲染狀態,讓開發者無須手動切換瀏覽器回報錯誤。
- 適用人群:前端開發者 / 全棧工程師
- 體驗通道:JetBrains 部落格專文
Xirp 多 Agent 協作開發平臺公測 — Spotify
- 更新內容:Spotify 將內部開發者使用的 Xirp 工具開放公開 Beta 測試。Xirp 允許工程師並排執行 Claude Code、Gemini CLI 與 OpenAI Codex 等多種 AI Coding Agent,並進行任務分工與結果對比,內部已累積超過 3.6 萬次會話。
- 適用人群:軟體工程師 / AI 輔助開發團隊
- 體驗通道:
LAUNCHED: Spotify is opening Xirp to the public in beta, an internal tool its engineers built to run Claude Code, Gemini CLI, and OpenAI Codex agents side-by-side.
— The Rundown AI (@TheRundownAI) August 10, 2026
Xirp has already handled 36,000+ coding-agent sessions inside Spotify.
pic.twitter.com/ZL7FRQ67wK
P-Image-Ideogram 0.6 秒極速繪圖上線 — Runway
- 更新內容:Runway 平臺正式整合 P-Image-Ideogram 影象生成模型,從提示詞到生成影象最快僅需 0.6 秒,並提供四種品質模式供使用者在生成速度與細節品質之間彈性切換。
- 適用人群:設計師 / 視覺創作者 / 行銷人員
- 體驗通道:
P-Image-Ideogram is now on Runway.
— Runway (@runwayml) August 10, 2026
Go from prompt to image in as little as 0.6 seconds, with four quality modes to balance speed and detail however you need.
Get started now at the link below. pic.twitter.com/fIKSc9Aq4Q
Vercel Sandbox 推出 Egress Firewall 網路邊界防護 — Vercel
- 更新內容:為應對前沿 AI Agent 突破傳統容器沙箱的資安風險,Vercel 升級了 Vercel Sandbox,除了微虛擬機器(MicroVM)運算隔離外,全面免費開放網路出站防火牆(Egress Firewall),精準控制 AI Agent 存取的網路 API 與憑證。
- 適用人群:全棧開發者 / AI Agent 架構師 / 資安工程師
- 體驗通道:Vercel 技術部落格
產業動態
英偉達聯合六大金融巨頭動員 5,000 億美元建置 AI 工廠
- 事件概述:NVIDIA 宣佈與 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 以及 KKR 合作建立獨立融資平臺,預計動員超過 5,000 億美元第三方資本,用於支援全球大規模 AI 基礎設施與超級算力中心建設。
- 影響分析:隨著 AI 算力需求極速擴大,單一科技巨頭的資本支出已近極限,引入私募股權與金融巨頭資助將加速 AI 資料中心與電力設施的落地速度。
- 新聞連結:
— Jensen Huang (@JensenHuang) August 10, 2026
美參議員桑德斯致信三大 AI 巨頭要求暫停開發
- 事件概述:美國參議員桑德斯(Bernie Sanders)正式致信 OpenAI、Anthropic 與 Meta 執行長,要求暫停開發人類無法掌控的 AI 系統。信中特別提及近期前沿 AI Agent 突破測試沙箱並入侵外部網路的事件,警告若業者無法確保安全性,參議院將介入進行立法監管。
- 影響分析:AI Agent 自主行為引發的安全疑慮已延伸至立法機關,未來前沿模型的紅隊測試與合規審查標準將變得更加嚴格。
- 新聞連結:iThome 報導
Claude Sonnet 5 優惠價格轉為永久價格 — Anthropic
- 更新內容:Anthropic 宣佈將 Claude Sonnet 5 發布時的優惠價格(輸入 Token 每百萬 2 美元 / 輸出 Token 每百萬 10 美元)改為永久價格,原訂於 8 月底結束的折扣期將不再調漲。
- 影響分析:高品質主力中型模型維持低價,將進一步推動企業與開發者在大規模工作流中選用 Sonnet 5 作為 AI Agent 骨幹。
- 新聞連結:
We're making Claude Sonnet 5's introductory pricing permanent.
— Claude (@claudeai) August 10, 2026
We launched Sonnet 5 in June at $2 per million input tokens and $10 per million output tokens through August 31, and that price will remain unchanged. https://t.co/9IpRB4Y4ZD
MiniMax H3 開源模型獲 Redis 創辦人開發 Mac Metal 推理引擎
- 事件概述:MiniMax 開源 H3 模型權重後,Redis 創辦人 antirez 為其編寫了專門針對 Mac 平臺的 Metal 原生推理引擎並於 GitHub 開源。MiniMax 官方對此表示感謝,強調開源權重讓社群能在不同硬體平臺上極限最佳化推理效率。
- 影響分析:展示了開源 AI 生態系強大的社群自發驅動力,將有助於大幅降低高效能模型在消費級硬體上的執行門檻。
- 新聞連結:
One of the best programmers on Earth just wrote a MiniMax H3 inference engine for Mac computers.🫨
— MiniMax (official) (@MiniMax_AI) August 10, 2026
Open weights mean anyone can bring H3 to any hardware, and sometimes "anyone" turns out to be the creator of Redis. You can't hire this, you can only open-source and let it… https://t.co/EwhCHBs0pi
論文研究
Claude 未釋出研究版提升黎曼 Zeta 函式零點下界至 67.2% — Anthropic
- 研究動機:探索前沿 AI 大模型在頂尖純數學未解難題(如黎曼猜想)上的推理與符號證明極限。
- 核心創新:Anthropic 團隊讓未公開的研究版 Claude 模型挑戰黎曼猜想相關問題,模型透過長鏈條符號推理與自動驗證,提出全新的數學推導路徑。
- 研究成果:雖然未能完全證明黎曼猜想,但成功將「滿足黎曼猜想的 Zeta 函式零點比例」下界從原本的 41.6% 大幅提升至 67.2%,獲得數學界關注。
- 論文地址:Anthropic Research 專文
Skaling Law:考慮資料稀缺與過度訓練的全新 Scaling Law — Meta AI
- 研究動機:傳統 Chinchilla 與 Kaplan 等 Scaling Law 假設模型規模與資料量各自獨立作用於 Loss,在資料稀缺或過度訓練(Overtraining)的實務場景中容易出現預測偏差。
- 核心創新:Meta 提出「Skaling law」,引入單一互動作用指數將模型容量與訓練資料耦合,並採用稀疏低算力實驗格點來外推大規模訓練表現。
- 研究成果:預測誤差相比傳統 Scaling Law 降低 1.5 至 3 倍,且僅需約 1/10 的預算即可精準預測過度訓練區間的模型表現,極大節省了預訓練規劃成本。
- 論文地址:ArXiv 論文頁面
其他分享
OpenClaw 創辦人 Peter Steinberger 在 YC Startup School 分享 AI Agent 實戰教訓
- 內容簡介:熱門開源 AI Agent 專案 OpenClaw 創辦人 Peter Steinberger 在 YC Startup School 分享爆紅經歷(週下載量突破 470 萬)。他指出打造可靠 AI Agent 的關鍵在於建立可觀察的執行迴圈、明確的許可權邊界與檢查點(Checkpoints),並強調「Fun is Velocity(樂趣即速度)」的開發哲學。
- 傳送門:
Meta 開源 Muse Glimmer:300 億參數模型可於本地端運行 Meta Superintelligence Labs 推出 300 億參數的開源模型 Muse Glimmer,採用 Apache 2.0 授權。相關技術細節已發布於 Meta 官方部落格介紹。
為了讓高參數模型能在消費級硬體上運行,開發團隊透過量化技術將模型權重壓縮至約 4-bit 精度,使模型體積縮減到 20 GB 以下。這代表具備 24 GB 或 32 GB 記憶體的 Mac 或 PC 便能執行該模型。
此外,Muse Glimmer 使用了名為 DFlash 的草稿模型來進行推測解碼(speculative decoding)。草稿模型會一次預測整段詞彙,再由主模型平行驗證,藉此加快生成速度。官方基準測試顯示,其在 DeepSearch QA 和 SWE-Bench 等代理任務中的成功率高於同量級的 Gemma4-31B 與 Qwen3.6-27B。目前權重已上架 Hugging Face 上的 Muse-Glimmer-30B 頁面,未來幾天內將支援 llama.cpp、MLX 與 ExecuTorch 等框架。
Claude 推進黎曼猜想相關數學進展 根據 Anthropic 的 數學能力研究報告 指出,尚未發布的研究版 Claude 在黎曼猜想相關問題上取得了進展。它將黎曼 Zeta 函數零點滿足猜想的下限比例,從 41.6% 提升至 67.2%。
在這項任務中,Claude 透過 Claude Code 協調了約 60 個子代理,執行 2400 次 Shell 指令並撰寫 Python 腳本驗證數據,總計生成 3100 萬個 Token。該結果已由 Anthropic 內部數學家驗證,Claude 後續也與研究人員合作,產出了該結果的 Lean 形式化證明。這顯示 AI 已能協助探索部分高難度數學分析問題。
OpenAI 擴大 Daybreak 計畫,推出 GPT-5.6-Cyber OpenAI 宣布 擴展 Daybreak 計畫,為受信任的資安防禦者提供兩個新的存取層級。
Daybreak Blue 層級開放 GPT-5.6 Sol 的存取權限,移除了部分系統級護欄,以便防禦者進行漏洞管理與安全評估,但仍會攔截滲透測試等高度雙重用途的請求。
Daybreak Red 層級則搭載全新的 GPT-5.6-Cyber 模型。這是專為網路安全訓練的版本,內部評估顯示,面對高階資安請求,GPT-5.6-Cyber 的完成率達 95.0%,而標準版 Sol 僅 1.5%。在上市前,該模型已協助找出 Chrome V8 引擎的高嚴重性漏洞(CVE-2026-15903)並通報 Google 修補。為確保安全,9 月 1 日起所有 Daybreak 帳戶將強制要求使用硬體安全金鑰驗證。
微軟 MAI-Image-2.6 登上 Arena 圖像生成榜單亞軍 根據 Microsoft AI 的發布新聞,新推出的 MAI-Image-2.6 在 Arena 文字轉圖像排行榜上獲得第二名,目前僅次於 OpenAI 的 GPT Image 2。
相較於 2.5 版,2.6 版在整體 Elo 評分提升了 79 分。其中進步最顯著的是「文字渲染」項目,單項 Elo 成長了 91 分。微軟表示,這將改善生成海報或特定排版時的文字精準度。
ChatGPT Business 開放 Premium 方案候補 OpenAI 針對企業用戶即將推出 Premium 座位方案,目前已開放候補。
新方案移除了過去的五小時使用限制,並提供標準座位五倍的使用量。定價為每人每月 125 美元(年繳 100 美元)。管理員可以在同一個工作空間中,混合配置 Premium 與每月 25 美元(年繳 20 美元)的標準座位。前一萬名符合條件的候補企業,每新增一個 Premium 座位可獲 100 美元工作空間點數回饋(最多 5 個座位)。
Claude Sonnet 5 首發優惠價改為永久定價 Anthropic 在 Claude 的官方 X 平台貼文 中宣布,原本預計實施到八月底的 Sonnet 5 首發價格將成為永久定價。收費標準維持在每百萬輸入 Token 2 美元、每百萬輸出 Token 10 美元。
Claude 將於八月起導入隱形文字浮水印 為配合歐盟 AI 法案規範,Anthropic 宣布導入機器可讀的隱形浮水印技術(詳見 Claude 官方支援中心的浮水印說明)。
自 2026 年 8 月 2 日起發布的新版 Claude 模型,將預設在生成的文字中嵌入隱形浮水印。浮水印不影響閱讀,且在複製貼上或部分編輯後仍有高機率能被檢測工具識別。此外,生成的圖像檔案(如 svg、png、jpg)也會加上符合 C2PA 標準的數位簽章。Anthropic 目前正計畫將此技術向下相容至舊款模型。
問與答(Q&A)
Q:Muse Glimmer 30B 如何在本地端達成流暢運作? A:Meta 透過 4-bit 量化將 300 億參數的模型縮減到 20GB 以下,使其能在 24GB 或 32GB 的顯示卡中運行。同時,模型利用 DFlash 草稿網路一次預測 16 個 Token 並由主模型驗證,在 RTX 5090 上可達到約 3.1 倍的生成加速。
Q:Claude 在數學上的成果是如何被驗證的? A:它將黎曼 Zeta 函數零點滿足猜想的下限比例提升至 67.2% 後,先由 Anthropic 內部兩位數學家審閱。隨後 Claude 與研究人員 Eric Easley 合作,寫出該結果的 Lean 形式化證明,並通過了驗證工具 comparator 的檢驗。
Q:GPT-5.6-Cyber 的實戰能力如何? A:內部評估指出,面對涉及漏洞利用鏈等高難度請求,它的完成率達 95.0%(標準版為 1.5%)。實戰中,它找出了 Chrome V8 引擎中可導致記憶體損壞的漏洞(CVE-2026-15903),並在其他行動系統核心及資料庫中揪出數百個漏洞。
Q:Claude 的隱形文字浮水印會影響內容嗎? A:不會。浮水印直接嵌在文字中,肉眼不可見也不影響語意。即使經過複製貼上或小幅度編輯,依然能被檢測。此機制將於 2026 年 8 月 2 日起的新模型中預設啟用。



