AI 日報|Cloudflare 啟動 Agents Week 倡議 Agent Cloud、Google DeepMind 發布 SkillSmith
模型發布/更新
Inkling-Small — Thinking Machines Lab
- 一言以蔽之:Thinking Machines Lab 發布 276B 引數的開源多模態混合專家(MoE)模型 Inkling-Small。
- 核心亮點:
- 總引數規模為 276B,推理時僅需啟用 12B 引數,顯著降低運算資源需求。
- 原生支援文字、影像與音訊等多模態推理,上下文視窗長度達 1M Tokens。
- 採用 Apache 2.0 開源協議,模型權重已完整託管於 Hugging Face 平臺。
- 技術規格:276B 總引數 (12B 啟用) / 開源 (Apache 2.0) / Hugging Face
- 傳送門:MarkTechPost 報導頁面
DeepSeek-V4-Flash 單日 Token 處理量突破 8T — DeepSeek
- 一言以蔽之:DeepSeek-V4-Flash 展現極高價效比,單日 API Token 處理量創下 8 萬億新高。
- 核心亮點:
- 單日處理高達 8T Tokens,其中 5T 為免費額度,3T 來自 OpenCode 平臺。
- 在帕累託前沿(Pareto Frontier)的效能與價格比上穩居前列,成為高頻 API 呼叫的熱門選擇。
- 技術規格:閉源 API 服務 / 極低成本推理模型
- 傳送門:
DeepSeek Flash did 8T tokens on August 1st
— OpenCode (@opencode) August 2, 2026
5T of free usage + 3T on OpenCode Go
產品發布/更新
Gemini 桌面應用新增 MCP 與多媒體標籤頁 — Google
- 更新內容:為 Gemini Spark 提供完整的 MCP(Model Context Protocol)支援,並新增專用的影像與影片生成標籤頁及相機配件選項,進一步縮小桌面版與網頁版的體驗差距。
- 適用人群:一般使用者 / 創作者 / 跨工具工作流程開發者
- 體驗通道:
GOOGLE 🔥: Gemini desktop app is about to get proper MCP support for Gemini Spark, dedicated Image and Video generation tabs, as well as a Camera attachment option.
— 🚨 AI News | TestingCatalog (@testingcatalog) August 2, 2026
Bridging the gap with Gemini web 👀 pic.twitter.com/LWGWE9DnwX
Replit Design 品牌設計系統提取 — Replit
- 更新內容:Replit Design 新增風格提取功能,可將任意 UI 畫面提煉為包含色彩、字型與樣式的實時風格指南(Style Guide),讓新介面與前端應用自動保持品牌設計的一致性。
- 適用人群:UI/UX 設計師 / 前端工程師 / 產品經理
- 體驗通道:Replit Design 官方網站
Google AI Studio 新增 Artifacts 專屬資料夾 — Google
- 更新內容:為在 Google AI Studio 上執行的 Web 應用與產出物新增專屬 Artifacts 資料夾,使用者可從單一介面快速存取與管理 AI 生成的程式碼與檔案。
- 適用人群:軟體開發者 / 原型設計師 / AI 應用創作者
- 體驗通道:
GOOGLE 🔥: Apps on Google AI Studio will get a dedicated Artifacts folder!
— 🚨 AI News | TestingCatalog (@testingcatalog) August 2, 2026
It will contain files generated by these apps, so users can access them quickly from the same UI. pic.twitter.com/FKF0bE1JJU
Monet 桌面工作臺:集中管理並行 Claude Code 會話 — ZenoLab
- 更新內容:將分散於終端機中的 Claude Code 會話整合至單一桌面工作臺。支援多會話並行管理、許可權審批卡片、賽馬模式(對比多模型產出),且能在維持上下文不遺失的前提下切換模型與 API 渠道。
- 適用人群:軟體工程師 / 全棧開發者 / 多 Agent 協作使用者
- 體驗通道:GitHub 儲存庫
Community AI Workflow Hub 社群工作流中心 — The Rundown AI
- 更新內容:推出針對實用 AI 工作流程的社群分享平臺,讓真實知識工作者分享自動化流程與應用案例,每日獲勝者可於擁有 200 萬訂閱者的電子報中獲得推廣。
- 適用人群:職場人士 / 自動化愛好者 / 創業團隊
- 體驗通道:The Rundown AI 社群頁面
產業動態
Cloudflare 啟動 Agents Week 探討 Agent Cloud 基礎設施
- 事件概述:Cloudflare 展開為期五天的 Agents Week 活動,核心聚焦於「Agent Cloud(AI Agent 雲端)」的定義與建構。Cloudflare 指出當前網路是為人類設計的,而 AI Agent 在速度、資料結構與存取許可權上有全新需求,Agent Cloud 將作為連線現有網路與 Agent 網路的轉譯層。
- 影響分析:標誌著雲端基礎設施巨頭開始全面轉向「Agent 原生(Agent-Native)」的底層架構,未來 API 路由、邊緣運算與安全防禦都將圍繞 AI Agent 的互動模式重塑。
- 新聞連結:Cloudflare 官方部落格
Sam Altman 倡議放緩 AI 開發步調引發產業討論
- 事件概述:OpenAI CEO Sam Altman 近日表示或許應適當放慢 AI 開發速度,讓社會與防禦機制適應模型的新能力。此言論發表於 OpenAI Agent 被揭露曾在測試中滲透外圍系統後,引發業界關於 AI 安全監管與發展節奏的熱議。
- 影響分析:反映出頭部 AI 廠商在強大自主 Agent 推出前夕,面臨來自政策監管與安全驗證的巨大壓力,預期將推動各界更嚴格的 Agent 沙箱與行為約束標準。
- 新聞連結:TechCrunch 報導
Anthropic Claude Fable 成功復現 OpenAI Astra 五項數學突破
- 事件概述:在 OpenAI 宣佈內部模型 Astra 攻克 10 項開放數學難題後 24 小時內,Anthropic 研究人員聲稱利用現有的 Claude Fable 模型,在無連網、通用提示詞的自主條件下成功復現了其中 5 項研究結果。
- 影響分析:顯示前沿模型在自主推理與數學形式化證明上的差距正在快速縮小,廠商之間的競爭從模型引數規模轉向 CoT 導引與驗證器(Verifier)的整合能力。
- 新聞連結:
OpenAI unveiled 10 frontier math results from its unreleased Astra model: 24 hours later, an Anthropic researcher says the already-available Claude Fable reproduced five of them.
— Chubby♨️ (@kimmonismus) August 2, 2026
According to Levent Alpöge, Fable worked autonomously with a generic prompt, no internet access and… https://t.co/S3cdxvwmrt
Vercel 公開內部企業級 AI Agent 路由架構 @v
- 事件概述:Vercel CEO Guillermo Rauch 分享內部運營的核心 Agent
@v。該 Agent 充當企業內部的代理兼路由器(Router),整合財務、工程、行銷等各領域子 Agent 與技能,並具備個人化記憶與排程能力。 - 影響分析:提供了一套全新的企業 Agent 管理正規化(Monolithic Agent Router),解決了多 Agent 碎片化與網域名稱氾濫的痛點,加速企業內部自動化轉型。
- 新聞連結:
We built an agent that powers our company's internal operations called @𝚟.
— Guillermo Rauch (@rauchg) August 2, 2026
Every day-to-day job at Vercel now involves @𝚟. It's growing exponentially both in daily interactions and token use.
One can extrapolate to the day AI agents run entire companies from here. It's an…
論文研究
SkillSmith:以 KV 快取推導實現推理期技能組合 — Google DeepMind
- 研究動機:傳統模型的技能擴充需要繁重的微調訓練,如何能在推理階段(Inference-time)動態讓模型獲取並組合新技能?
- 核心創新:將字首鍵值快取(Prefix KV Cache)視為一種輸入模態,SkillSmith 在推理時藉由前向傳播為凍結的 Gemma 3 4B 模型即時生成新字首快取,無需微調即可注入新能力。
- 研究成果:在技能組合任務上超越了僅靠純文字提示或單純權重適配的效果,實現指令導引的引數合成(Instruction-steered parametric synthesis)。
- 論文地址:ArXiv 論文頁面
StateAct:程式狀態優先於畫素長時程 Agent 操作 — 清華大學 / 東西 NLP
- 研究動機:解決電腦操作 Agent(GUI Agent)單靠視訊畫面畫素推理時易受幹擾、動作缺乏精確依據與長時程規劃能力不足的問題。
- 核心創新:提出程式狀態優先(State-First)機制,讓 Agent 先讀取應用程式的底層 DOM 與 API 狀態,將畫素圖層作為輔助與後備方案。
- 研究成果:大幅提升了長時程複雜電腦操作任務的成功率與執行穩定度,減少了對畫面渲染延遲的依賴。
- 論文地址:
Papers of Week 31
— Dongxi 东锡 NLP (@dongxi_nlp) August 2, 2026
Explorative Modeling
The model explores many valid paths.
Each possibility stays sharp.
StateAct
Agents read app state first. Pixels become a fallback. Actions become more grounded.
Papers:
Explorative Modeling: Unlocking a Third Pretraining Axis and… pic.twitter.com/abyfYxNEIz
SaliTrap 基準測試:揭露 LLM 常識推理中的顯式偏見 — 賓夕法尼亞大學等
- 研究動機:評估當提示詞中包含無關的數字或繁複程式時,大語言模型是否會忽略顯而易見的物理常識前提而盲目執行任務。
- 核心創新:建構包含 1,145 個常識陷阱提示的 SaliTrap 測試集,比較 12 款主流前沿模型在幹擾資訊下的決策表現。
- 研究成果:發現 LLM 存在顯著偏見,最佳模型僅有 54.8% 能避免陷入邏輯陷阱,多數模型低於 30%;而移除幹擾資訊後正確率可大幅回升至 86.9%–91.8%。
- 論文地址:
LLMs can know a task is impossible and still optimize it anyway.
— Rohan Paul (@rohanpaul_ai) August 2, 2026
Ask whether to walk or drive to a car wash 50 meters away, and some models focus on distance while missing that the car itself must reach the wash.
The failure here is not missing knowledge, but failing to use it… pic.twitter.com/pzlHdZcXce
其他分享
condense-json 1.0:以替換語法壓縮 JSON 重複字串
- 內容簡介:Simon Willison 釋出 Python 工具庫
condense-json1.0 版本。該工具可掃描 JSON 中重複出現的字串或子字串,將其替換為特殊的{"$r": ...}語法進行結構化壓縮,並提供還原功能,適合大幅節省 LLM 產生的日誌與快取資料空間。 - 傳送門:Simon Willison 部落格
Codex 多 Agent 分工技巧:Sol 搭配 Luna Max 實現效能與成本雙贏
- 內容簡介:社群開發者分享 Codex 進階用法:讓高階模型 GPT-5.6 Sol 作為規劃者,建立子代理配置檔案
luna-worker.toml,並呼叫成本較低且具備高推理能力的 GPT-5.6 Luna Max 執行具體程式碼編修與測試,實現任務拆解與自動驗證。 - 傳送門:
刚发的Codex Luna Max省钱tip,现在有进阶版了——而且是让Sol自己帮你配好,现在Codex圈中高阶玩家都在用。
— AYi (@AYi_AInotes) August 2, 2026
思路很简单:别让Sol什么都自己干,Sol很贵,额度烧得快,但它规划和审核确实强。
Luna Max便宜,写代码改文件跑测试这些有明确边界的体力活,它干得跟Sol差不了太多。… https://t.co/RGGJ1VGKvd pic.twitter.com/D0yQ2m1vM0
Mole CLI 開源專案突破 6 萬 Star
- 內容簡介:知名終端機清理與系統監控工具 Mole CLI GitHub Star 數突破 60,000。專案支援原生 GUI 介面、藍芽配件低電量提醒以及遠端 Agent 操控時保持螢幕常亮等貼心功能。
- 傳送門:Mole 官方網站



