news

AI 日報|Google 發布 Gemini 3.8 Flash 與 Cyber、Meta 推出 Muse Spark 1.3、Claude 支援背景電腦操作

September 3, 2026
Updated Sep 3
5 min read
google
AI 日報|Google 發布 Ge
gemini
le 發布 Gemini 3.8 F
meta
Cyber、Meta 推出 Mu
spark
Muse Spark 1.3、C
claude
k 1.3、Claude 支援背景電
amp
lash & Gemi
news
AI 日報|Google 發布 Gemini 3.8 Flash 與 Cyber、Meta 推出 Muse Spark 1.3、Claude 支援背景電腦操作
2026-09-03

AI 日報|Google 發布 Gemini 3.8 Flash 與 Cyber、Meta 推出 Muse Spark 1.3、Claude 支援背景電腦操作


模型發布/更新

Gemini 3.8 Flash & Gemini 3.8 Flash Cyber — Google DeepMind

  • 一言以蔽之:Google 於 6 週內迎來第 3 次 Flash 重磅迭代,同步推出軟體工程強化版 Flash 與首款專用資安防禦模型 Flash Cyber。
  • 核心亮點
    • 長程工程推理躍升:在 DeepSWE v1.1 評測中達到 73.7% 解決率,在提示詞注入(Prompt Injection)抵抗評測中被攻破率僅 5.5%(遠低於同級模型 50%+),大幅提升多步驟 Agent 自主容錯與驗證頻率。
    • 專用資安旗艦版:同步推出的 3.8 Flash Cyber 在 CyberGym 基準測試中取得 86.2%、CWE-Bench 修復達 47.2%,並在內部 20 種程式語言的漏洞挖掘測試中展現超過 70% 的成功率。
  • 技術規格:1M Context Window / 閉源商用(提供 Government & Enterprise Fairwind 計畫)/ 輸入 $0.75、輸出 $3.75 每百萬 Token(2026 年底前優惠)
  • 傳送門Google DeepMind 官方部落格

Meta Muse Spark 1.3 — Meta

  • 一言以蔽之:Meta 推出全新一代 Muse Spark 1.3,以極致價效比直逼第一梯隊前沿模型,並預告開源權重版本即將到來。
  • 核心亮點
    • 價效比與長程任務強化:在 Artificial Analysis Intelligence Index 取得 61-62 分(逼近 Claude Fable 與 GPT-5.6),相較 1.2 版本減少 20% 工具呼叫與 25% Token 消耗。
    • 主動協作機制:模型在長流程任務中具備自我邊界校準能力,能主動向使用者提出澄清問題,並在關鍵破壞性操作前主動請求確認。
  • 技術規格:1M Context Window / 支援文字、圖片與 PDF 輸入 / Contributor 計費輸入 $0.10、輸出 $0.20 每百萬 Token
  • 傳送門Meta Developer 官方頁面

Claude Fable 5.1 & Claude Mythos 5.1 — Anthropic

  • 一言以蔽之:Anthropic 正式推出面向超複雜推理與長程 Agent 工作流程的全新旗艦模型 Fable 5.1 與 Mythos 5.1。
  • 核心亮點
    • WebDev Code Arena 登頂:Fable 5.1(Max)以 1,765 分重新整理紀錄,以領先第二名 77 分的顯著差距重塑高階 Pareto 前沿線。
    • 系統性快取大幅降價:快取讀取(Cache Read)價格調降達 75%,使長對話及多步驟 Agent 迴圈的整體呼叫成本降低 25% 至 31%。
  • 技術規格:1M Context Window / 支援動態思考模式(Adaptive Thinking)/ 商用 API 與 Claude Pro/Max
  • 傳送門Anthropic 官方公告

Qwen3.8-Max-0902 — 阿里通義千問

  • 一言以蔽之:通義千問升級旗艦模型 Qwen3.8-Max-0902,專門強化程式設計與協作後訓練,重新整理開源衍生架構在 Web 開發評測的高分紀錄。
  • 核心亮點
    • 評測榜單新標竿:在 Code Arena: WebDev 上以 1,691 分位居綜合前列,在資料分析與消費級產品生成分類位列第一。
    • 混合定價優勢:以每百萬 Token 輸入 $2、輸出 $6 的極具競爭力價格,提供 2.4T 引數規模與 1M 上下文處理能力。
  • 技術規格:2.4T 總引數 / 1M Context Window / 支援 QwenCloud API 與顯式/隱式快取
  • 傳送門

產品發布/更新

Claude 背景自動電腦操作 (Background Computer Use) — Anthropic

  • 更新內容:Claude Cowork 與 Claude Code 正式支援 macOS 原生背景操作功能。使用者派發任務後,Claude 可在背景自主進行應用程式點選、文字輸入與視窗切換,使用者可同時在前景處理其他工作;首次操作新應用程式時會彈出安全授權,並支援預先封鎖敏感應用。
  • 適用人群:[軟體工程師 / 辦公自動化重度使用者 / 生產力極客]
  • 體驗通道

Cursor Self-Hosted Machines 自託管執行節點 — Cursor

  • 更新內容:Cursor 推出 Self-Hosted Machines 功能,允許企業將 Cursor 雲端 Agent 的終端工具執行與沙箱環境部署在自有的內部網路或專用機器上,而規劃與推理迴圈仍由 Cursor 雲端負責,兼顧內部敏感資料安全性與雲端模型算力。
  • 適用人群:[企業級開發團隊 / 敏感資料受監管機構 / 基礎架構工程師]
  • 體驗通道Cursor 官方技術部落格

Lily 本地端推理引擎開源 — Perplexity

  • 更新內容:Perplexity 正式開源專為 Apple Silicon 打造的高效本機推理引擎 Lily,針對 Qwen3.6-35B-A3B 架構深度最佳化。在 M5 Max 實測下,Lily 較 MLX-LM 達成 1.23 倍 Prefill 吞吐量與 1.35 倍 Decode 吞吐量提升,全力支援 Perplexity Computer 混合運算。
  • 適用人群:[Mac 本地 AI 開發者 / 邊緣運算研究者 / 開源社群]
  • 體驗通道

Mantis 開源漏洞挖掘與自動修復 Harness — Google Cloud

  • 更新內容:Google Cloud 開源內部用於大規模尋找並自動修復漏洞的 Agent Harness 框架 Mantis。透過結合審查 Agent、批評 Agent 與安全沙箱,自動重現漏洞並調研歷史修復脈絡,大幅降低傳統 AI 程式碼掃描的高誤報率問題。
  • 適用人群:[DevSecOps 工程師 / 開源維護者 / 企業資安團隊]
  • 體驗通道Google Cloud 官方部落格

Claude Code v2.1.259 (託管 MCP 與無人值守模式) — Anthropic

  • 更新內容:Claude Code 發布 v2.1.259 更新,新增組織級 managedMcpServers 集中託管設定,並引入 --permission-prompts none 引數以支援無人值守的 Headless CI/CD 執行模式,同時加入 GitLab MR 指令辨識支援。
  • 適用人群:[DevOps 工程師 / 自動化工作流架構師 / 開發團隊主管]
  • 體驗通道Claude Code GitHub Releases

產業動態

彭博報導:NVIDIA 傳接近以最高 140 億美元收購 Hugging Face

  • 事件概述:據彭博社報導,NVIDIA 正與全球最大開源 AI 社群平臺 Hugging Face 深入洽談收購,交易總估值可能落在 129 億至 140 億美元之間,其中包含約 10 億美元的員工留任激勵計畫。
  • 影響分析:若交易達成,NVIDIA 將完成從 GPU 底層算力、CUDA 軟體層到頂層開源模型分發社群的完整閉環,但也可能引發開發者社群對開源中立性與反壟斷審查的高度關注。
  • 新聞連結

美國司法部就版權訴訟遞交意見書:AI 訓練原則上應屬「合理使用」

  • 事件概述:美國司法部在紐約時報與 OpenAI 的訴訟中向法院提交非約束性陳述意見書,主張利用版權文字進行大語言模型訓練具有高度「轉化性(Transformative)」,通常應符合合理使用原則,並警告過度的許可限制將損害美國國家安全與 AI 競爭力。
  • 影響分析:這項政策立場為面臨版權訴訟的 AI 基礎模型研發廠商帶來重大利多,但司法部仍強調具體輸出若涉及直接複製或非法的資料抓取管道,法院仍須個案判定。
  • 新聞連結

OpenAI GPT-6-Astra 端點曝光,Recurrent Depth 推理技術引發 CoT 安全監管爭議

  • 事件概述:開發者在 OpenAI 官方 API 上發現 gpt-6-astra 模型路由端點;與此同時,《The Information》披露 Astra 採用了被稱為 Recurrent Depth(不透明迴圈)的全新推理技術,透過迴圈疊代處理查詢而不再生成標準可讀的思維鏈(CoT)。
  • 影響分析:AI 安全專家(如 Gary Marcus 等)對此發布強烈預警,認為隱藏或弱化思維鏈可解釋性將嚴重破壞目前 AI 監管與可控性的脆弱防線,在追求模型效能極限的同時放大了對齊失控風險。
  • 新聞連結TechCrunch 深度分析

Palo Alto Networks 斥資 5 億美元收購 AI 服務臺新創 Console

  • 事件概述:網路安全巨頭 Palo Alto Networks 宣佈以 5 億美元收購成立僅兩年的 AI IT 服務臺新創 Console,其 Agent 核心功能將整合至 Palo Alto 的 Cortex 資安平臺中。
  • 影響分析:顯示 SecOps 與 ITOps 領域正加速由「工單系統」轉向「自然語言 Agent 自主調查與修復」,大型資安廠商透過併購垂直 AI 新創加速生態壁壘建立。
  • 新聞連結TechCrunch 報導

論文研究

HarnessEvolve: Leveraging Reference Trajectories for Reliable Agentic Self-Evolution — 研究團隊

  • 研究動機:自主進化的 AI Agent 在無監督環境下經常遭遇三大困境:終態反饋導致錯誤歸因不清、過度擬合特定任務模式,以及未受保護的引數/提示更新破壞既有能力。
  • 核心創新:提出 HarnessEvolve 框架,引入「參考軌跡(Reference Trajectories)」引導機制,將 Agent 每次演化的探索步幅與黃金基準進行對齊,並建立多層回滾與隔離防護欄。
  • 研究成果:在多項長時程自我演化基準測試中,有效消除了災難性遺忘,將 Agent 在未知新任務上的自主泛化成功率提升了 38%。
  • 論文地址arXiv:2609.00829 論文連結

Do Graph Memories Truly Outperform Flat Retrieval in Long-Term Agents? — 研究團隊

  • 研究動機:社群普遍認為知識圖譜記憶(Graph Memory)必然優於傳統扁平向量檢索(Flat Retrieval),本研究旨在以嚴格實驗驗證此假設在長對話 Agent 中的真實表現。
  • 核心創新:在 LongMemEval 基準上比對實體圖譜兩跳子圖檢索與標準向量搜尋,並評估基於時間、存取頻率及中心度的遺忘剪枝模組。
  • 研究成果:研究發現圖譜記憶在需要精確回溯歷史助理輪次的對話中表現反而較差(F1 分數下降 0.05,精確率由 0.911 降至 0.607);但其四因子遺忘模組能在完全不損害 F1 的前提下安全剪除近 10% 的冗餘節點。
  • 論文地址arXiv:2608.28978 論文連結

The Anatomy of Effective Commerce Agents — Anthropic 研究與工程團隊

  • 研究動機:針對零售、電商與旅遊等複雜業務,探討多 Agent 分工與單一強大 Agent 迴圈在生產環境下的架構優劣。
  • 核心創新:打破業界習慣按領域拆分過多子 Agent 的模式,提出以單一 Claude 搭配標準 Agent 迴圈、動態載入技能與 MCP 工具的統一架構,並開源 commerce-agents 參考實現。
  • 研究成果:實測證實單一整合架構能顯著減少跨 Agent 傳遞帶來的上下文丟失與通訊 Token 開銷,大幅提升長流程購物與商家營運任務的履約率。
  • 論文地址Anthropic 官方研究與實踐指南

其他分享

zg (zvec-grep):統一 ripgrep、BM25 與向量檢索的本機優先搜尋工具 — Qwen 開發者團隊

  • 內容簡介:Qwen 開發團隊開源了名為 zg(zvec-grep)的本機優先搜尋層工具。它將精確正規表示式搜尋(ripgrep)、關鍵字演演演算法(BM25)以及語意向量檢索整合成單一 CLI 與 API 介面,預設模型無需 GPU 即可在 CPU 上極速執行,專為本地 Agent 檢索打造。
  • 傳送門zg 開源專案與 NPM 安裝頁面

fable51-worlds:Claude Fable 5.1 AI Agent 叢集純 Three.js 程式化 3D 街區重建 — PhiloLabs

  • 內容簡介:PhiloLabs 發布開源專案 fable51-worlds,展示由自主 Claude Fable 5.1 Agent 叢集端到端完成調研、3D 程式化建模與自動質檢的真實街區重建專案。成果完全以純 Three.js 程式碼交付,無需使用大型遊戲引擎或專有 3D 格式即可在瀏覽器端流暢探索。
  • 傳送門GitHub - PhiloLabs/fable51-worlds

FrontierSWE v2 超長程程式設計評測基準發布 — Proximal

  • 內容簡介:評測機構 Proximal 發布 FrontierSWE v2 超長程軟體工程基準測試,擴充了複雜任務集與評測方法。最新測試顯示,新發布的 Claude Fable 5.1 在跨檔案、超長程式碼重構任務中展現出對其他前沿模型的顯著領先優勢。
  • 傳送門
分享至:
Featured Partners

© 2026 Communeify. All rights reserved.