AI 日報 | 2026-09-01
💡 此文章是自動產生,於每天早上九點自動更新。
模型發布/更新
Hermes Agent v0.21.0 (Pantheon Release) — Nous Research
- 一言以蔽之:Nous Research 正式釋出 Hermes Agent v0.21.0,引入突破性的「Bot Mode」與多 AI Agent 協同群組聊天架構。
- 核心亮點:
- 內建 Bot Mode:讓多個具備專屬外觀與角色的 AI Agent 組成社群,彼此透過群組聊天協同合作,如同專業團隊而非單一工具箱。
- 支援定時任務(Cron Jobs)記憶與連續性、即時調整子 AI Agent(Subagent Steering)及增強的瀏覽器操控能力。
- 技術規格:開源多 AI Agent 框架 / 支援 Agent 間通訊 (A2A) / 桌面端整合
- 傳送門:GitHub 官方釋出公告
產品發布/更新
Grok Build v1.0.15 與 Grok Bot 微軟生態外掛 — xAI
- 更新內容:xAI 針對 Grok Build 推出 v1.0.15 更新,大幅提升會話開關速度與首條回覆延遲;同時 Grok Bot 正式推出 Microsoft 整合外掛,深度打通 Outlook、Calendar 與 OneDrive,並新增 Linux (AppImage / RPM) 官方下載支援。
- 適用人群:[開發者 / 企業辦公族 / Linux 使用者]
- 體驗通道:
BREAKING: SpaceXAI has released another major new update for Grok Build (v1.0.15)
— DogeDesigner (@cb_doge) August 31, 2026
v1.0.15 makes Grok Bot faster and smoother. Sessions now open and close faster, first replies arrive sooner, typed input is handled better, and new tips make copying or exporting content easier.… pic.twitter.com/5hbcS1CvAG
AI Gateway 新增使用者層級預算管控與 fx 轉接器 — Vercel
- 更新內容:Vercel AI Gateway 推出全新功能,允許團隊管理者針對每位使用者設定獨立的美元消費額度(支援每日、每週或每月重置),有效防止無監督執行的 AI Agent 或程式碼編寫工具耗盡共享預算。同日 AI SDK 亦宣佈支援輕量級開源 AI Agent
fx轉接器。 - 適用人群:[軟體工程師 / 團隊主管 / 平臺維運]
- 體驗通道:Vercel 官方更新日誌
產業動態
OpenAI Codex 活躍使用者突破 2,500 萬 — OpenAI
- 事件概述:OpenAI 官方宣佈旗下專為程式碼編寫設計的 Codex 活躍使用者數已正式達到 2,500 萬,並呈現指數級成長。為慶祝這一里程碑,官方宣佈重置所有 ChatGPT Work 與 Codex 付費訂閱的使用額度。
- 影響分析:顯示 AI 程式碼編寫助理已成軟體開發者的標配工具,且在企業市場的滲透速度遠超預期。
- 新聞連結:
While Anthropic is losing users, OpenAI is gaining users massively for Codex at the same time.
— Chubby♨️ (@kimmonismus) August 31, 2026
Currently, the growth is exponential. And admittedly, I'm a user myself and can understand why. https://t.co/4QIE22aHAn pic.twitter.com/6qPTTj2wWE
智譜 GLM-5.3 Flash 全面執行於國產晶片叢集 — 智譜 AI
- 事件概述:投資人 Emad Mostaque 轉發並披露智譜最新動態,指出其推出的 GLM-5.3 Flash 是該公司首個完全執行在國產晶片叢集上的模型,透過約 10 萬張國產加速卡實現大規模低成本推理,端到端服務效能較基線提升三倍。
- 影響分析:展現非美系前沿 AI 實驗室在面對供應鏈挑戰時,成功透過本土硬體生態達成大規模商用落地與成本最佳化。
- 新聞連結:
something something RSI
— Emad (@EMostaque) August 31, 2026
which they intend to use fully for GLM 6.0
GLM 5.3 is based on pre-train from start of year, scaling up massively on data environments as web data tapped out
$2b ARR!
Lot's of interesting stuff in here https://t.co/I5G57IQQ6u pic.twitter.com/qrYIxc9UoM
Cloudflare 發表 Adaptive Intelligence 抵禦自動化機器人攻擊 — Cloudflare
- 事件概述:Cloudflare 正式推出 Adaptive Intelligence 安全防禦機制,利用 AI 技術主動對抗由確定性惡意攻擊者發起的複雜自動化機器人 (Bot) 攻擊,徹底扭轉防禦方的經濟劣勢。
- 影響分析:在 AI 大幅降低攻擊門檻的時代,資安防禦必須轉向由 AI 驅動的動態適應機制,以維持企業成本效益優勢。
- 新聞連結:Cloudflare 官方部落格
論文研究
LLM 排行榜名次高度依賴評測配置:以 Gemma4 31B 得分 31% 至 89% 波動為例 — 獨立研究團隊
- 研究動機:現有大語言模型排行榜的公信力經常受到質疑,外界好奇不同的評測設定對模型最終名次的影響究竟有多大。
- 核心創新:在一項針對固定 12 個模型與 3,679 個問題的研究中,研究人員僅調整提示詞格式、選項順序與打分方式等常規評測設定,觀察模型的效能變化。
- 研究成果:發現 Gemma4 31B 的得分竟能在 31% 到 89% 之間大幅波動,且 12 個模型中有 4 個至少在一種設定下排到第一,揭示了評測方式不統一帶來的巨大不穩定性。
- 論文地址:
LLM rankings can be created by evaluation choices as much as model differences, so one setup should never decide the leaderboard.
— Rohan Paul (@rohanpaul_ai) August 31, 2026
The paper keeps the models and 3,679 questions fixed, then changes only ordinary evaluation choices such as prompt format, option order, and scoring… pic.twitter.com/KkPjxQNx9N
From Leaderboards to Model Profiles:AI 程式碼編寫模型的深度評估解析 — JetBrains
- 研究動機:當多個前沿 AI Agent 在基準測試中獲得完全相同的解題率時,傳統排行榜無法反映其真實的執行行為與成本差異。
- 核心創新:JetBrains ML 團隊深入分析不同實驗室模型(如 Claude Opus 4.7 與 Gemini 3.5 Flash)在相同程式碼編寫任務中的執行檔與呼叫特性。
- 研究成果:提出模型檔案(Model Profiles)概念,指出解決率相同的模型在呼叫次數、上下文消耗與推理模式上存在顯著差異,為開發者選擇模型提供更深度的依據。
- 論文地址:JetBrains 官方部落格
其他分享
KAIST 推出 SweepLED:結合 AI 與智慧型手機 LED 燈精準偵測隱藏攝影機 — KAIST
- 內容簡介:南韓科學技術院 (KAIST) 開發出名為 SweepLED 的創新隱藏攝影機檢測技術,結合智慧型手機的 LED 燈與 AI 模型,準確率高達 94%,且額外硬體裝置成本僅需 1 萬韓元,大幅提升日常隱私安全保障。
- 傳送門:Chosun 英文報導



