AI 日報 | 2026-08-18
💡 此文章是自動產生,於每天早上九點自動更新。
模型發布/更新
Grok 4.6 登頂 Artificial Analysis Agentic Index — xAI
- 一言以蔽之:xAI 旗艦模型 Grok 4.6 在 Artificial Analysis Agentic Index 以 59 分高分登頂,與 Claude Opus 5 Max 並列全球第一。
- 核心亮點:
- 自主解決問題能力突破:在工具呼叫、長程規劃與複雜問題解決的指標測試中表現出色。
- 極致成本效益:平均約 53 輪對話完成任務,單次任務平均成本僅 $0.84,展現強大的 CP 值與 Pareto 邊界優勢。
- 技術規格:閉源模型 / Artificial Analysis Agentic Index 59 分
- 傳送門:
Grok is very good at agentic tasks! https://t.co/qrk4htUMiR
— Elon Musk (@elonmusk) August 17, 2026
Sakana Namazu — Sakana AI
- 一言以蔽之:Sakana AI 發布基於 Kimi K2.6 架構構建的專業模型 Sakana Namazu,正式上線 OpenRouter。
- 核心亮點:
- 日本文化深度感知:將對日本在地文化與語言的深刻理解與高效能邏輯推理相結合。
- 全能工具鏈:內建網路搜尋與程式碼執行能力,專為處理企業真實商業場景中的複雜任務設計。
- 技術規格:基於 Kimi K2.6 / 閉源 API / 支援網路搜尋與程式碼執行
- 傳送門:OpenRouter 模型頁面
Dreamina Seedance 2.5 1080p 升級與 Video Arena 登頂 — BytePlus / 抖音集團 (ByteDance)
- 一言以蔽之:ByteDance 旗下的 Dreamina Seedance 2.5 影音生成模型推出原生 1080p 解析度支援,並在 Video Arena「影片編輯」類別拿下榜首。
- 核心亮點:
- 原生高畫質輸出:1080p 解析度配合原生 10-bit 色彩,帶來更銳利的紋理與自然光影,滿足影視級生產需求。
- Video Arena 登頂:在 Video Arena 影片編輯榜上以 1411 分高居第一,領先第二名達 23 分。
- 技術規格:原生 1080p / 10-bit 色彩 / 多模態影音生成
- 傳送門:
Exciting news: Dreamina Seedance-2.5 by @BytePlusGlobal is topping ranks in Video Arena! It currently ranks #1 in Video Edit, the industry’s newest video capability category, which has only 9 models on the leaderboard so far.
— Arena.ai (@arena) August 17, 2026
#1 Video Edit Arena: 1411 pts - a large 23 pts gap… https://t.co/mYmYFn55g6 pic.twitter.com/zZNVdFgPdo
產品發布/更新
Cursor Origin AI 原生程式碼託管平臺 — Cursor
- 更新內容:Cursor 正式推出程式碼託管服務 Origin(早期測試版),專為 AI Agent 高頻協作與自動併發開發打造。Origin 打破傳統 Git 的人工審查節奏,支援每秒 22.6 次提交,並整合了 Graphite 堆疊式 PR 管理與 AI 自動衝突修復。現已支援與 GitHub 雙向同步以及 Vercel / Buildkite 自動部署。
- 適用人群:全棧開發者 / AI 驅動軟體工程團隊
- 體驗通道:Cursor 官方 Changelog
Claude Code /design 命令與畫板工作流 — Anthropic
- 更新內容:Anthropic 為 Claude Code CLI 與 Desktop 引進全新的
/design研究預覽技能。開發者輸入/design即可喚起來自 Claude Design 的可編輯 UI 畫板(Artifacts),在圖形介面上調整視覺樣式後,由 Claude 自動將設計轉譯為生產級程式碼。 - 適用人群:前端工程師 / 產品設計師 / 獨立開發者
- 體驗通道:
Claude Code can design now. The new /design skill (research preview) brings Claude Design's artboard workflow into the CLI and Desktop, built on artifacts.
— ClaudeDevs (@ClaudeDevs) August 17, 2026
Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it. pic.twitter.com/uttl4F1G0e
AgentCore Payments AI AI Agent 自動付費中介軟體 — LangChain & AWS
- 更新內容:LangChain 與 AWS 聯合推出 AgentCore Payments 中介軟體,解決 AI Agent 在呼叫付費 API 時遇到的 HTTP 402 Paywall 障礙。當 API 回傳 402 時,系統會自動比對會話預算並進行數位簽署付費,且所有消費紀錄與推理邏輯都會自動同步至 LangSmith,提供完整的審計軌跡。
- 適用人群:AI Agent 架構師 / 後端開發團隊
- 體驗通道:LangChain 部落格文章
Agent Development Kit (ADK) 零信任 AI Agent 構建框架 — Google
- 更新內容:Google 開源了基於 ADK 和 Gemini 的零信任客服與退貨 AI Agent 範例。該架構在 LLM 上下文之外建立三層防護:硬體加密簽名確保資料庫寫入不可否認、gVisor 沙箱隔離動態程式碼執行、以及確定性語意閘道器校驗業務邏輯,有效防範 Prompt 注入等安全攻擊。
- 適用人群:資安工程師 / AI Agent 開發者
- 體驗通道:Google Developers 部落格
ElevenLabs MCP for Claude — ElevenLabs
- 更新內容:ElevenLabs 推出專用 MCP (Model Context Protocol) Server,讓使用者能直接在 Claude 介面中管理與呼叫語音 AI Agent。使用者可直接檢視語音 Agent 效能、建立新 Agent、更新組態,並在變更上線前預估 LLM Token 成本。
- 適用人群:語音 AI 應用開發者 / 產品經理
- 體驗通道:
Introducing the ElevenLabs MCP, now available in Claude.
— ElevenLabs (@ElevenLabs) August 17, 2026
Your team can manage your voice and chat agents where you already work - review recent performance, create new agents, update configurations, and even estimate LLM costs before changes go live. pic.twitter.com/RkGqlr3I0h
Junie 預設模型切換至 Gemini 3.7 Flash 並享 6 折優惠 — JetBrains
- 更新內容:JetBrains 宣佈其 AI 助手 Junie 將預設編碼模型升級為 Google Gemini 3.7 Flash,並提供限時 40% 折扣優惠。Gemini 3.7 Flash 在 DeepSWE v1.1 測試中,長程軟體工程任務解決率達 65.3%(顯著高於舊版 3.6 Flash 的 49.0%),能以更低成本提供精確的程式碼生成。
- 適用人群:JetBrains IDE 使用者 / CLI 開發者
- 體驗通道:JetBrains Junie 部落格
Cumora 開源 AI Agent 團隊協作工作區 — yetone / 開源社群
- 更新內容:開發者 yetone 開源 Slack 風格的 AI Agent 協作平臺 Cumora,讓 AI Agent 成為團隊頻道中的實體成員。Agent 具備獨立人設與記憶,能傳送私聊、認領任務與傳送郵件;支援 Cloud 託管與 BYOA (Bring Your Own Agent) 本地執行模式,並內建原子任務鎖定機制避免競態衝突。
- 適用人群:遠端團隊 / 開發團隊 / AI 工作流整合者
- 體驗通道:GitHub 專案庫
產業動態
NVIDIA 與 SB Energy 簽署俄亥俄州 PORTS-Pike 園區電力協議,OpenAI 將作為主要租戶 — NVIDIA / SB Energy / OpenAI
- 事件概述:NVIDIA 宣佈與 SB Energy 合作,鎖定俄亥俄州 PORTS-Pike 科技園區 4.25 GW 的電力容量,獨家部署 NVIDIA AI 工廠,而 OpenAI 將作為主要租戶入駐,預計每代系統部署約 150 萬顆 NVIDIA GPU。
- 影響分析:這是歷史上最大規模的資料中心基礎設施交易之一,鎖定了直到 2030 年的算力與電力供應,進一步鞏固了 OpenAI 與 NVIDIA 在超大規模 AI 訓練上的深度繫結。
- 新聞連結:NVIDIA 官方部落格
AirTag 實測揭露:亞馬遜大量採購珍本圖書掃描訓練 AI 後予以毀棄 — 404 Media / Amazon
- 事件概述:科技媒體 404 Media 透過藏在珍本圖書中的 AirTag 追蹤,發現亞馬遜位於拉斯維加斯的 VGT3 AI 訓練中心大量採購稀有實體書籍,並拆解掃描為文字資料用於前沿 AI 模型訓練,掃描完成後即予以銷毀。
- 影響分析:這是首次有直接證據證實科技巨頭為獲取高品質版權外訓練資料,正透過商業渠道秘密採購並拆毀實體珍本書籍,引發了出版界與圖書館界對版權保護與文化資產儲存的巨大爭議。
- 新聞連結:404 Media 獨家報導
AI 工作流自動化初創公司 Relay 宣佈關停,團隊加入 Google Chrome — Relay / Google
- 事件概述:AI 工作流自動化工具 Relay 宣佈將於 9 月 14 日終止服務。創辦人兼 CEO Jacob Bank 將重返 Google 出任 Chrome 產品副總裁,帶領團隊推動 Chrome 瀏覽器與 AI Agent 的原生協作與整合。
- 影響分析:反映出獨立 AI 自動化初創公司在巨頭生態包夾下的生存壓力,同時預示著 Google 正將 Chrome 瀏覽器定位為下一代 AI Agent 的核心作業環境。
- 新聞連結:TechCrunch 報導
論文研究
Harness-IF:測試編碼 AI Agent 對衝突指令的遵循能力 — 抖音集團 (ByteDance)
- 研究動機:當使用者的明確指令與 AI Agent 的預設行為模式或預置系統 Prompt 產生衝突時,評估 Agent 能否克服慣性、嚴格遵循使用者約束。
- 核心創新:構建 Harness-IF 對抗性基準,涵蓋 60 個多輪程式設計任務,將對抗指令分散於系統 Prompt、工具描述與專案檔案中。
- 研究成果:測試 12 個前沿模型發現,所有模型在面對與預設慣性衝突的指令時表現均顯著下降,顯示出目前的 Agent 可控性與指令遵循能力仍被高估。
- 論文地址:
New ByteDance paper asks a much better question about AI agents: did the instruction actually change anything?
— Rohan Paul (@rohanpaul_ai) August 17, 2026
We might be overestimating how controllable AI agents are because our tests often agree with their defaults.
Want to know whether your agent actually follows… pic.twitter.com/UblOpujrXo
其他分享
GitSkills:收錄 380 萬份 SKILL.md 的 AI Agent 技能資料集 — 開源社群
- 內容簡介:開源社群整理並發布了 GitSkills 資料集,從 GitHub 上 28 萬個公共儲存庫中挖掘出 380 萬份符合 SKILL 格式的檔案,去重歸併為 187 萬個獨立技能內容。該資料集以單一 SQLite 檔案提供,為研究 Agent 技能觸發機制與模式蒸餾提供了豐富的基石。
- 傳送門:
Recommended resource. Largest dataset of agent skills I’ve come across. Great for mining cool ideas and patterns for your agents. https://t.co/z00rGoYPaT
— elvis (@omarsar0) August 17, 2026



