AI日報|Gemini 月活破十億、Manus 獨立營運、OpenAI 測試廣告
快訊
模型發布/更新
Nemotron 3.5 Lightning & NeMo Switchyard — NVIDIA
- 一言以蔽之:NVIDIA 推出專為常駐 AI Agent 設計的 30B 開源 MoE 模型,生成速度最高提升 4 倍,並配套開源模型路由庫 NeMo Switchyard。
- 核心亮點:
- 高效能常駐 Agent 引擎:從 Nemotron 3 Ultra 蒸餾而來,具備 30B 總引數與 3B 啟用引數,支援高達 1M Token 長上下文,任務完成速度加快 30%。
- 動態模型路由(Switchyard):配套開源 Switchyard 路由庫,能將 93% 的例行任務分發給 Nemotron 3.5 執行,僅 7% 複雜推理轉交前沿模型,降低約 70% 總成本。
- 技術規格:30B 引數(3B 啟用)/ 1M Context / Apache 2.0 開源授權(提供 BF16 與 NVFP4 權重)
- 傳送門:NVIDIA 官方部落格
MAI-Code-1.1-Flash — Microsoft AI
- 一言以蔽之:微軟最新程式碼模型 MAI-Code-1.1-Flash 登陸 GitHub Copilot,新增原生視覺能力且價格大幅下降 73%。
- 核心亮點:
- 多模態程式碼理解:原生支援視覺輸入,能直接理解 UI 設計圖與架構圖並自動轉換為程式碼。
- 極致價效比:相比前代 MAI-Code-1-Flash 價格降低 73%,且在指令遵循、工具呼叫與程式碼品質上全面升級。
- 技術規格:閉源專用程式碼模型 / 整合於 GitHub Copilot App、CLI 及 VS Code
- 傳送門:
📣 @MicrosoftAI's MAI-Code-1.1-Flash is now rolling out in GitHub Copilot.
— GitHub (@github) August 11, 2026
➡️ It has native vision support for image understanding
➡️ Delivers improvements across coding quality, instruction following, tool use, and performance
➡️ 73% lower list price than MAI-Code-1-Flash,…
Ling-3.0-tiny — 螞蟻百靈 (InclusionAI)
- 一言以蔽之:螞蟻百靈開源原生混合推理模型 Ling-3.0-tiny,推理時僅需啟用 1.3B 引數即可處理真實複雜任務。
- 核心亮點:
- 超低資源消耗:總引數 7.9B,推理啟用引數僅 1.3B,極大地降低了本地及邊緣部署的記憶體門檻。
- 全量量化支援:官方同步提供 BF16、FP8 及 INT4 三種精度版本,利於各類硬體適配。
- 技術規格:7.9B 引數(1.3B 啟用)/ MoE 架構 / 開源模型權重
- 傳送門:Hugging Face 模型頁面
產品發布/更新
Grok Bot 雲端 AI 團隊夥伴 — xAI / SpaceXAI
- 更新內容:xAI 推出 Grok Bot 早期測試版,每個 Bot 均獲得獨立的雲端電腦環境。使用者可授權 Grok Bot 登入各類 SaaS 工具,自主執行銷售線索挖掘、郵件自動回覆、發票核對等長流程作業,且 Bot 之間能在群組中協同工作。
- 適用人群:企業管理員 / 行銷團隊 / 營運人員 / 開發者
- 體驗通道:
Introducing Grok Bot https://t.co/K4ww4Sm0pk pic.twitter.com/bhgHp1Vkhv
— a16z (@a16z) August 11, 2026
Linux 版 ChatGPT 桌面應用預覽版 — OpenAI
- 更新內容:OpenAI 正式推出適用於 Linux 系統的 ChatGPT 桌面端預覽版,同步支援 Ubuntu、Debian 與 Fedora。新應用整合了 ChatGPT、ChatGPT Work 與 Codex,並支援專案、聊天紀錄與技能外掛的跨平臺自動同步。
- 適用人群:Linux 開發者 / 全棧工程師 / 系統管理員
- 體驗通道:
Now in preview: The ChatGPT desktop app for Linux.
— OpenAI (@OpenAI) August 11, 2026
Use ChatGPT, ChatGPT Work, and Codex where you already work and build, with your projects and browser workflows on supported Linux systems. pic.twitter.com/OtsPt5N5QC
Agent Client Protocol (ACP) 開放標準 — JetBrains WebStorm
- 更新內容:JetBrains 在 WebStorm 中引入 ACP(Agent Client Protocol)開放標準。如同 LSP 解耦編輯器與程式語言,ACP 解耦了 IDE 與 AI Coding Agent,允許開發者直接在 WebStorm 內連線 Anthropic、OpenAI 或 Google 的訂閱,無須額外繫結 IDE 專屬 AI 訂閱。
- 適用人群:Web 開發者 / 前端工程師 / 軟體架構師
- 體驗通道:JetBrains 部落格專文
Seedance 2.5 角色與音樂同步更新 — Runway
- 更新內容:Runway 生成式影片工具 Seedance 2.5 正式上線,單次支援最多 50 個獨特角色參考,並能生成最長 30 秒且與背景音樂節奏精準同步的動態影片片段。
- 適用人群:影視創作者 / 動畫師 / 廣告製作人
- 體驗通道:
A full cast, a full track, one generation at a time.
— Runway (@runwayml) August 11, 2026
Seedance 2.5 is live on Runway, with 50 unique character references and clips up to 30 seconds synced to music. Get started at the link below. pic.twitter.com/TWBbLHfYzd
產業動態
Gemini 月活躍使用者突破 10 億大關 — Google
- 事件概述:Google 執行長 Sundar Pichai 宣佈,Gemini 應用月活躍使用者數(MAU)已跨越 10 億大關,成為 Google 歷史上成長最快的產品,也是第 14 款使用者突破 10 億的產品。此外,Gemma 開源模型家族累計下載量也達到了 10 億次。
- 影響分析:Gemini 透過深度嵌入 Android、Workspace 與 Google 搜尋 AI 專區,實現了大規模使用者普及,與 OpenAI ChatGPT 正式進入雙雄並駕齊驅的「十億使用者時代」。
- 新聞連結:Google 官方部落格
ChatGPT 正式測試廣告展示 — OpenAI
- 事件概述:OpenAI 公佈將開始在 ChatGPT 免費版及低階訂閱中測試廣告展示,以維持免費服務的可持續性。OpenAI 強調廣告將帶有清晰標籤,且回答生成過程嚴格獨立,絕不向廣告主出售使用者對話個資。
- 影響分析:隨著龐大的推算資源成本壓力居高不下,訂閱制已無法滿足 AI 巨頭的營運支出,匯入廣告商業模式將成為消費級 AI 平臺獲利化不可避免的趨勢。
- 新聞連結:OpenAI 官方公告
三大 AI 巨頭 API 爆發加密推理軌跡外洩漏洞 — 安全研究
- 事件概述:安全研究人員發現 OpenAI、Anthropic 與 Google 返回給客戶端的「加密思維鏈(CoT)」區塊存在可重放漏洞。攻擊者可將強模型的加密推理軌跡重放給同家族弱模型並進行越獄,從而解密還原出強模型原始隱藏推理,並在數萬條會話中提取出 62 個 API 金鑰與密碼。各廠商已於收到通報後完成修復。
- 影響分析:這揭示了前端看似安全的「加密思維鏈」機制在跨模型許可權隔離上的設計缺陷,AI 提供者在維護思考隱私與防範對抗性解密上需建立更嚴格的安全屏障。
- 新聞連結:Simon Willison 部落格專文
Manus 宣佈恢復獨立公司運營 — Manus
- 事件概述:熱門 AI Agent 產品 Manus 在官方部落格宣佈將恢復作為一家獨立公司營運。為配合特定司法管轄區的法規調整,部分使用者被要求於 8 月 23 日前完成資料備份,並於 8 月 25 日起透過恢復入口進行轉移。
- 影響分析:Manus 營運架構的獨立化變革顯示出前沿 AI 應用在面對全球資料合規與資本運營時的彈性調整,未來產品發展方向備受社群關注。
- 新聞連結:
A Note to Our Users
— Manus (@ManusAI) August 11, 2026
Manus will soon resume operating as an independent company.
As part of this transition and to comply with regulatory requirements in specific jurisdictions, some users will need to back-up their data before 7:59 a.m. on August 23, 2026 (SGT) and then begin…
論文研究
AMIE:具備實時臨床影片問診能力的醫療 AI 系統 — Google Research / Google DeepMind
- 研究動機:探索具備多模態實時互動能力的 AI 在遠距醫療與臨床診斷中的實戰可行性。
- 核心創新:基於 Gemini 與 Project Astra 打造 AMIE 醫療 AI 系統,使其能夠即時解讀視覺與聽覺線索、引導患者進行虛擬體格檢查,並進行動態臨床推理。
- 研究成果:在隨機對照研究中,專業醫師對 AMIE 在病史採集與診斷準確率等維度的表現給予高度肯定,模擬患者亦表現出更強的信任感與偏好。
- 論文地址:Google Research 部落格
Dyna-2:基於百萬小時人類影片預訓練的世界動作模型 — Dyna Robotics
- 研究動機:傳統機器人訓練高度依賴昂貴且難以擴充套件的機器人軌跡資料(Robot Trajectories),限制了物理智慧(Physical Intelligence)的 Scaling Law。
- 核心創新:提出跨具身 Scaling Law,完全不使用任何機器人軌跡資料,而是直接在超過 100 萬小時的人類日常生活影片上進行世界動作模型預訓練。
- 研究成果:證明人類經驗資料能直接跨越具身鴻溝(Embodiment Gap)。經百萬小時預訓練後,機器人僅需數小時甚至數分鐘的實機微調,即可將複雜雙手操縱任務的成功率由 20% 提升至 53% 以上。
- 論文地址:Dyna Robotics 技術報告
ExtractBench:企業級複雜檔案資訊擷取評測基準 — LlamaIndex
- 研究動機:現有檔案擷取評測集規模過小且型別單一,無法反映現實中跨頁長檔案、手寫掃描件與超級複雜表格的真實痛點。
- 核心創新:涵蓋 8 大真實領域(金融、醫療、能源、法律等)、67 種檔案型別、總計 4,869 頁檔案,並全面評測 14 種前沿多模態模型(VLM)、Coding Agent 與專用 API。
- 研究成果:揭露了即便是目前最強的前沿模型在應對超 1000 行跨頁表格與精準空間標註時仍存在顯著瓶頸,為下一代檔案 AI Agent 提供了明確的最佳化方向。
- 論文地址:ArXiv 論文頁面
其他分享
從零打造 AI Coding Agent:600 行 TypeScript 教學專案 — SaladDay
- 內容簡介:針對許多開發者想了解 AI Coding Agent 內部機制的需求,社群創作者 SaladDay 將上萬行程式碼的生產級 Agent 專案(如 pi)解構並精簡為僅 600 行 TypeScript 的教學專案。專案清晰展示了上下文記憶體管理、工具呼叫(Tool Calling)與命令執行迴圈的底層邏輯,非常適合初學者上手學習。
- 傳送門:GitHub 專案倉庫
今天的 AI 新聞涵蓋了幾項重要的商業與技術變動。OpenAI 開始在免費版測試廣告,Google Gemini 宣布月活躍用戶達到 10 億。技術方面,有研究揭露了 LLM API 隱藏推理軌跡的洩漏風險。以下是具體細節:
OpenAI 在 ChatGPT 免費版測試廣告
OpenAI 官方宣布正在美國地區針對成年免費用戶(包含 Free 與 Go 方案)測試廣告功能。官方表示,贊助內容會根據使用者的對話主題、歷史紀錄或先前的廣告互動來投放,並會有明確標示。OpenAI 強調廣告商無法存取詳細聊天紀錄,只能收到整體數據;此外,涉及身心健康或政治等敏感主題的對話不會顯示廣告。
如果免費用戶不想看到廣告,可以在設定中關閉,但每日的免費訊息額度也會相應減少。另外,ChatGPT 桌面版應用程式也透過官方 X 宣布推出了 Linux 預覽版,支援 Ubuntu (24.04/26.04 LTS)、Debian 13 以及 Fedora (43/44),提供 .deb 與 .rpm 格式,並相容 x64 與 ARM64 架構。
SpaceXAI 測試 Grok Bot:在雲端共用電腦的 AI 代理
根據 SpaceXAI 的最新發布,其推出的 AI 代理系統 Grok Bot 進入早期測試階段。它的主要設計是讓多個 Bot 在雲端共用一台虛擬電腦。
使用者可以透過文字指示 Grok Bot 執行任務,例如更新 CRM 紀錄或處理信件,這些 Bot 在使用者離開座位時仍會繼續運作。官方展示的案例中,企業可以設定一個「幕僚長」機器人來分配工作給處理特定任務(如招募或財務)的其他機器人,並在遇到需要判斷的決策時標記人類介入。目前此功能開放給 SuperGrok Heavy 等特定付費方案用戶。
研究揭露 LLM API 可被提取隱藏的推理軌跡
一份名為 《Stolen Thoughts》 的研究指出,部分大型語言模型(如 Anthropic、OpenAI 與 Google 的 API)在處理思維鏈(CoT)時存在資料外洩風險。
模型提供商為了維持對話連貫,會將加密的思維區塊傳給客戶端。研究團隊發現,若將高階模型產生的加密區塊,注入到同一家廠商已被「越獄」的較弱模型中,較弱模型解碼後,會將原本隱藏的推理過程以純文字輸出。
研究團隊藉此還原了超過三十萬個隱藏思維。分析結果顯示,其中包含了 API 金鑰、密碼與個人信箱等隱私資料,甚至包括模型思考如何進行犯罪攻擊的過程。這代表現行的隱藏思維機制在多模型交互時,存在安全盲區。
NVIDIA 推出輕量級 MoE 模型 Nemotron 3.5 Lightning
NVIDIA 正式發布了 擁有 300 億參數的混合專家(MoE)模型 Nemotron 3.5 Lightning。官方數據指出,該模型每次處理單一 token 只需啟動 30 億個活躍參數。
在官方公布的 PinchBench 測試中,該模型準確率達 86%,且處理代理任務的速度優於 Qwen3.6 35B。此模型支援在 GeForce RTX 5090 等設備上進行本地部署(已於 Hugging Face 上公開提供權重下載)。搭配 NVIDIA 的路由工具,系統可將複雜任務交給高階模型,而將高頻的工具呼叫交給 Lightning 模型處理。
影片生成模型 LTX 2.5 開放下載
LTX 2.5 開源基礎模型 已釋出開源權重(也可至官方釋出的 Hugging Face 資源頁面 下載)。開發團隊表示,新引入的渲染技術能依據場景複雜度動態分配運算資源,改善了影片生成的動態偽影問題。
在生成速度上,官方測試顯示,若在配備 2 台伺服器級 NVIDIA GB200 GPU 的環境下,生成 10 秒的 720p 影片約需 6.8 秒。模型最低硬體需求為 16GB VRAM,對年營收低於 1000 萬美元的企業開放免費商業使用,且無強制浮水印。
微軟在 GitHub Copilot 實裝 MAI-Code-1.1-Flash 模型
微軟最新發布的 MAI-Code-1.1-Flash 輕量級代碼模型已部署至 GitHub Copilot 生產環境。
根據微軟公布的數據,新模型在 Terminal-Bench 2.1 測試中性能提升 22%;串流速度加快了 25%,且完成任務所需的 token 消耗減少了 25%。官方表示,透過優化真實使用數據,該模型的運行成本已降至前一代的四分之一。
Manus 脫離 Meta 獨立營運,部分用戶資料需重新備份
AI 代理平台 Manus 近日向使用者發出重要通知,宣布結束 Meta 在 2025 年底的收購,恢復獨立營運。因應部分地區的監管法規,收購日後由特定用戶產生的資料將在 2026 年 8 月 23 日至 24 日(SGT)期間被刪除。
受影響用戶需在 8 月 23 日上午 7:59 前完成備份,系統將於 8 月 25 日重新開啟資料還原通道。特別需要注意的是,使用 Apple ID 或 Facebook 註冊的用戶,因系統沒有電子郵件紀錄,只會透過 App 內推播通知。未受影響的帳號則可正常使用。
Mistral 擴展區域推論選項與算力基礎設施
Mistral AI 發表最新聲明,宣布擴大其基礎設施服務。客戶現在可選擇將推論資料限制在歐洲或美國區域內處理(少數受監管的子處理器除外)。
此外,Mistral 推出服務級別協定(SLA)來保障企業的正常運行時間,並開始在平台上支援第三方開源模型(首波為 Z.ai 的 GLM-5.2)。長期規劃方面,官方計劃在 2030 年前於歐洲建置 1 GW 的運算容量供企業承租。
Google 展示醫療 AI 系統 AMIE 的視訊看診模擬研究
Google Research 與 DeepMind 發布了 醫療 AI 系統 AMIE 的最新研究進展。AMIE 基於 Gemini 架構,設計用來同時處理視覺與聽覺資訊。
在一項針對「模擬病患演員」的雙盲測試中,AMIE 能夠引導虛擬理學檢查並給出初步診斷。研究指出,臨床評估人員對 AMIE 在詢問病史與溝通上的表現給予正面評價。不過 Google 也強調,系統目前仍處於研究階段,距離實際臨床部署還有一段距離。
Anthropic 擴大 Compliance API 支援範圍
Anthropic 宣布其 Claude 企業版的 Compliance API 正式擴大涵蓋範圍。除了既有的 Claude 聊天對話外,現在也支援各平台的 Claude Cowork 以及 CLI / 桌面版的 Claude Code。
系統會將對話紀錄、提示詞與工具呼叫等資料整合為單一逐字稿,並附帶使用者 ID 與時間戳記。不過,目前在網頁版、Claude Platform 或雲端平台(如 Amazon Bedrock)上運行的 Claude Code 工作階段,尚未納入此 API 記錄中。
Hugging Face 社群釋出語音模型 IndexTTS-2.5
Hugging Face 開源社群的 IndexTeam 發布了零樣本文字轉語音模型 IndexTTS-2.5,並同步提供 展示網頁 供外界體驗。
該模型支援跨語言語音生成(包含中、英、日、西、阿拉伯文),只需一小段參考音檔,就能還原說話者的聲音特徵並轉換為不同語言。開發者也可以透過輸入情感向量或參考文字,來調整合成語音的情緒。
Google 表示 Gemini 應用程式月活躍用戶達 10 億
Google 官方釋出了振奮人心的數據,指出 Gemini 應用程式的月活躍用戶(MAU)已達 10 億。
官方公布的使用者輪廓顯示:有 63% 的使用者會使用語音對話;五分之一的 Gemini Live 請求結合了鏡頭畫面或螢幕分享;38% 的學術相關請求附有檔案。在平台分佈上,iOS 端活躍用戶超過 1 億,Android 端則已實裝超過 40 款應用的自動化操作。
問與答(Q&A)
- ChatGPT 廣告影響範圍: Plus、Pro、Business 等付費方案用戶完全不會看到廣告。免費版用戶若關閉廣告,每日免費訊息額度將會減少。
- LTX 2.5 的硬體需求迷思: 官方宣稱的「6.8 秒生成 10 秒影片」,是在配備 2 台伺服器級 NVIDIA GB200 GPU 的環境下測得。雖然一般 16GB VRAM 顯卡也能跑,但速度會慢上許多。
- Manus 備份通知盲區: 使用 Apple ID 或 Facebook 登入的 Manus 帳戶,因為系統沒有綁定 Email,只能依靠 App 內通知。受影響用戶需自行留意 8 月 23 日的期限。
- Mistral 資料區域限制的例外: 雖然 Mistral 提供區域端點,但根據其 Trust Center 條款,仍有少數受監管的資料會傳輸給區域外的子處理器。合規要求嚴格的企業需特別評估此條款。



