news

AI日報|Twitch預設AI訓練惹議、LiteLLM資安危機外洩多個巨頭憑證、Google揭露LLM事實提取瓶頸

August 13, 2026
Updated Aug 13
5 min read
google
個巨頭憑證、Google揭露LLM事
anthropic
gle 和 Anthropic 也釋出了日
deepseek
發布/更新 DeepSeek V4 Pr
claude
測指標逼近 Claude Fable
grok
PI 檔案 Grok 4.6 —
xai
4.6 — xAI / Spa
news
AI日報|Twitch預設AI訓練惹議、LiteLLM資安危機外洩多個巨頭憑證、Google揭露LLM事實提取瓶頸
2026-08-13

AI日報|Twitch預設AI訓練惹議、LiteLLM資安危機外洩多個巨頭憑證、Google揭露LLM事實提取瓶頸

今天的 AI 圈很熱鬧,但也出了一些亂子。開源模型與 API 持續推進,Google 和 Anthropic 也釋出了日常實用的更新。但同時,LiteLLM 的資安漏洞與 Twitch 的預設授權爭議,再次凸顯了 AI 基礎設施與隱私政策的脆弱。以下是今日重點。

快訊

模型發布/更新

DeepSeek V4 Pro (0813) — DeepSeek

  • 一言以蔽之:DeepSeek 無預警釋出旗艦模型 DeepSeek V4 Pro (0813 版本),綜合評測指標逼近 Claude Fable 5,且 API 價格大幅降低。
  • 核心亮點
    • 前沿級推理能力:在多項綜合推理與程式碼評測中超越 Opus 4.8,逼近 Fable 5 表現,顯著提升複雜 AI Agent 任務的成功率。
    • 極致價效比:每百萬 Token 輸入僅需 $3 美元(快取命中僅 $0.025 美元),輸出 $6 美元,相比同級前沿模型價格低近百倍。
  • 技術規格:1.5T 引數 MoE 架構 / 閉源 API 提供(預計後續開放權重)
  • 傳送門DeepSeek 官方 API 檔案

Grok 4.6 — xAI / SpaceXAI

  • 一言以蔽之:xAI 正式發布新一代旗艦模型 Grok 4.6,主打長時執行 AI Agent,在程式設計、法律與辦公等多項評測中全面登頂。
  • 核心亮點
    • 長時執行 Agent 引擎:具備 500K Token 長上下文視窗,處理複雜長流程與互動式任務的速度與成功率大幅提升。
    • 評測全面奪冠:在 OfficeQA Pro (63.2%)、Harvey 法律基準 (22.0%) 及 3DCodeBench 等多項挑戰中拿下第一,綜合分數追平 GPT-5.6 Sol。
    • 價格優勢:每百萬 Token 輸入 $2 美元、輸出 $6 美元,價格僅為同級前沿模型的一半。
  • 技術規格:閉源旗艦模型 / 500K Context / 支援文字與影像輸入
  • 傳送門xAI 官方公告

MAI-Thinking-1 — Microsoft AI

  • 一言以蔽之:微軟首款從零打造的自主推理模型 MAI-Thinking-1 登陸 Microsoft Foundry,展現深度思考能力。
  • 核心亮點
    • 強化邏輯推理:採用原生思維鏈(CoT)架構,專門針對數學證明、複雜程式碼開發與長流程決策最佳化。
    • Foundry 開放體驗:企業開發者可直接在 Microsoft Foundry 平臺上進行測試與整合。
  • 技術規格:閉源專用推理模型 / 上線於 Microsoft Foundry
  • 傳送門微軟官方公告

SL2T 手語轉文字模型 — Google DeepMind

  • 一言以蔽之:Google DeepMind 推出手語轉文字模型 SL2T,能即時將美語手語(ASL)翻譯為文字並整合至 Pixel 11 裝置。
  • 核心亮點
    • 端側隱私保護:採用端側骨骼姿態追蹤(Pose Tracking),無須將影像上傳至雲端即可完成即時手語辨識。
    • 日常場景最佳化:針對單手握持手機等真實生活情境最佳化,首波於 Pixel 11 上的 Gboard 與 Live Transcribe 登場。
  • 技術規格:多模態手語翻譯模型 / 端側姿態追蹤 + 雲端文字翻譯
  • 傳送門Google DeepMind 官方部落格

Muse Glimmer (30B) — Meta AI

  • 一言以蔽之:Meta AI 超級智慧實驗室發布 30B 開放權重多模態模型 Muse Glimmer,專為本地 AI Agent 設計。
  • 核心亮點
    • 強悍的 Agent 基準:在 MCP Atlas 取得 75.5 高分、SWE-Bench Pro 達 51.2,展現優秀的工具呼叫與程式碼修復能力。
    • 完全開源授權:採用 Apache 2.0 授權,支援文字與影像混合輸入,方便社群進行微調與本地部署。
  • 技術規格:30B 密集引數 / 多模態(文字+影像)/ Apache 2.0 開源授權
  • 傳送門OpenRouter 模型頁面

WeLM-617B — 微信 (Weixin Team / Tencent)

  • 一言以蔽之:騰訊微信團隊發表自主研發的 WeLM 大模型家族,主打高效能資源比與生態系深度整合。
  • 核心亮點
    • 極致資源效率:針對日常對話與多模態識圖最佳化,提供 617B 等不同規模版本,大幅降低推算成本。
    • 微信生態應用:已於微信朋友圈「AI 幫寫」與公眾號創作工具等場景進行灰度測試與應用落地。
  • 技術規格:自研大語言模型 / 閉源提供內部與生態合作夥伴
  • 傳送門

產品發布/更新

Claude in Chrome (Cowork 側邊欄) — Anthropic

  • 更新內容:Anthropic 升級 Chrome 瀏覽器擴充功能側邊欄,將其重構為 Claude Cowork 會話。使用者可在瀏覽器中發起任務,對話紀錄、技能(Skills)與聯結器(Connectors)將跨桌面端、網頁端與行動端無縫同步。
  • 適用人群:辦公族 / 知識工作者 / 全平臺 Claude 使用者
  • 體驗通道Anthropic 部落格專文

Gemini Connected Apps (MCP 整合) — Google

  • 更新內容:Gemini 宣佈新增 14 款外部應用程式連結(如 Zoho Bigin、Granola 等),並引進開放式 MCP (Model Context Protocol) 協定,讓使用者能在 Gemini 對話方塊內直接讀取商業資料、整理開會筆記與管理專案進度。
  • 適用人群:企業使用者 / 專案經理 / 效率達人
  • 體驗通道Google 官方部落格

PyCharm 2026.2.1 Agent 協調器與實時 Kernel — JetBrains

  • 更新內容:PyCharm 發布 2026.2.1 更新,新增「Agent Environment Coordinator」功能,確保 AI Agent 精準識別虛擬環境,防止套件誤裝至系統 Python,將任務成功率提升至 98%;此外,為 AI Agent 提供實時 Jupyter Kernel 存取,避免連線中斷導致 Token 浪費與模型狀態遺失。
  • 適用人群:Python 開發者 / 資料科學家 / 機器學習工程師
  • 體驗通道JetBrains 部落格專文

Vercel AI Gateway Coding Agent 一鍵設定 — Vercel

  • 更新內容:Vercel AI Gateway 推出全新的 vercel ai-gateway coding-agents setup 指令,開發者可一鍵將 Claude Code、Codex、OpenCode 等多款 Coding Agent 統一導流至 AI Gateway,隨心切換 Grok 4.6 或 DeepSeek V4 等 200+ 款模型,並實施統一預算與控制策略。
  • 適用人群:軟體工程師 / 全棧開發者 / 技術團隊主管
  • 體驗通道Vercel 更新公告

產業動態

Made by Google 2026 旗艦硬體發布會 — Google

  • 事件概述:Google 舉辦 Made by Google 2026 發布會,正式發表 Pixel 11 系列(搭載 Tensor G6 晶片與全新相機硬體)、Pixel 11 Pro Fold 折疊手機、Pixel Watch 5 以及首款採用藍芽頻道探測技術的 Pixel Tag 防丟器,全面強化 Gemini AI 於硬體端側的整合應用。
  • 影響分析:Google 透過升級硬體晶片與 Gemini 的深度結合,持續開拓「硬體 + 端側 AI」的商業生態系,為使用者提供更快且安全的個性化 AI Agent 驗。
  • 新聞連結Google 官方部落格

Lovable 完成 4 億美元 C 輪融資,估值衝上 133 億美元 — Lovable

  • 事件概述:熱門 AI 軟體構建平臺 Lovable 宣佈完成 4 億美元 C 輪融資,公司估值達到 133 億美元。該公司致力於透過自然語言對話讓使用者輕鬆建置生產級軟體應用。
  • 影響分析:資本市場對「AI 程式碼寫入/無程式碼建置」領域持續注入大量資金,Lovable 的超高估值顯示出 AI 生成軟體(AI-generated Software)市場強勁的成長潛力。
  • 新聞連結

Cognition 洽談 400 億美元估值,年化收入將突破 10 億美元 — Cognition

  • 事件概述:AI 軟體工程師 Devin 的開發者 Cognition 正洽談融資超過 10 億美元,公司估值上看 400 億美元。據報導,其年化執行收入(ARR)已接近 10 億美元,Devin 在企業端的使用量於半年內實現每月 50% 的高速成長。
  • 影響分析:Autonomous Coding Agent 從初期的技術展示快速演進為企業必備工具,軟體工程領域正迎來由 AI Agent 驅動的生產力暴增時代。
  • 新聞連結

LiteLLM 遭嚴重供應鏈攻擊,洩漏逾 43 萬 CI/CD 憑據 — 安全事件

  • 事件概述:開源 AI 金鑰與管道封裝工具 LiteLLM 遭到嚴重的供應鏈攻擊,攻擊者在短短 40 分鐘內竊取了約 43.4 萬個 CI/CD 流水線憑據,波及微軟、亞馬遜、英偉達、思科等超過 2,500 家組織。
  • 影響分析:這場攻擊暴露了現代 AI 開發基礎設施在開放供應鏈中的脆弱性,開發團隊應立即更換相關 API 金鑰與憑據,並強化 CI/CD 管道的安全稽核。
  • 新聞連結Ars Technica 專題報導

Twitch 預設開啟亞馬遜 AI 訓練,開放使用者選擇退出 — Twitch / Amazon

  • 事件概述:Twitch 宣佈將預設使用平臺創作者的直播內容來訓練母公司 Amazon 的生成式 AI 模型。面對社群的強烈反彈,Twitch 現已在隱私設定中提供手動「選擇退出(Opt-out)」功能。
  • 影響分析:大型科技公司利用平臺創作者內容進行 AI 訓練引發廣泛版權與隱私爭議,預設條款與 Opt-out 機制正成為影音平臺合規性面臨的主要挑戰。
  • 新聞連結TechCrunch 報導

論文研究

MindTopo:多模態模型空間與拓撲推理能力評測 — Microsoft Research

  • 研究動機:檢驗當前多模態大模型(VLM)是否真正理解視覺空間中的「拓撲關係」(如連通性、包圍、順序與結點),而非僅靠表面紋理識別。
  • 核心創新:提出了 MindTopo 評測基準,涵蓋靜態拓撲識別與動態互動規劃,測試模型在連續操作中能否保持正確的結構關係。
  • 研究成果:發現現有多模態模型在靜態圖片上表現良好,但在動態規劃任務中極易喪失拓撲一致性,揭示了具身智慧與機器人視覺規劃的關鍵瓶頸。
  • 論文地址Microsoft Research 論文介紹

Recall 是引數化事實性的瓶頸:WikiProfile 基準與知識畫像 — Google Research

  • 研究動機:探索前沿 LLM 生成事實性錯誤(Hallucination)的根本原因:究竟是模型沒有學到該知識,還是學到了卻「想不起來」。
  • 核心創新:提出了知識畫像(Knowledge Profiling)分析框架,並構建包含 2,150 條維基百科事實與 21,500 個提問的 WikiProfile 測試基準。
  • 研究成果:研究證實 Gemini 3、GPT-5 等前沿模型的事實編碼已趨於飽和,絕大多數錯誤來自於「檢索/回憶失敗(Recall Failure)」而非「資訊缺失」,為未來模型記憶體檢索機制提供了最佳化方向。
  • 論文地址Google Research 部落格

Prompt 無限膨脹之謎:CLAUDE.MD / AGENTS.md 增長原因與註釋最佳化 — DAIR.AI / ArXiv

  • 研究動機:分析為何 AI Agent 專案中的系統提示詞(如 CLAUDE.mdAGENTS.md)會隨時間無限制地增長,導致內容冗餘與效能下降。
  • 核心創新:對 1,867 個專案倉庫中的 247,694 條指令進行生命週期分析,並提出透過編寫「推理註釋(Rationale Comments)」來管理指令增長。
  • 研究成果:發現每條指令平均隨 Commit 淨增 4.9 項規範;而引入推理註釋可消除 99.3% 的過期冗餘指令,並將 Agent 的實際指令遵循能力提升最高 23.1%。
  • 論文地址ArXiv 論文頁面

其他分享

Waku:基於 Rust + GPUI 的 Coding Agent 原生桌面面板 — Open Source

  • 內容簡介:開源社群推出了 Waku 桌面應用,使用 Rust 與 GPUI 引擎打造。它能為 Claude Code、Codex、OpenCode 等各式 Coding Agent CLI 提供一個輕量、極速且視覺化的多工協作視窗,非常適合偏好 GUI 又追求極致效能的工程師。
  • 傳送門Waku 專案官網

Qwen3.8-2.4T-A95B 開源權重釋出

Qwen 團隊今日釋出 Qwen3.8-2.4T-A95B 模型權重。這是一個總參數 2.4 兆、啟動參數 950 億的混合專家架構(MoE)模型。 官方文件指出,該版本原生支援高達 262,144 個 Token 的上下文,並強制開啟思考(Thinking)模式。開發者可透過調整推理力度(reasoning_effort)來控制運算成本。需注意的是,此開源版僅限純文字輸入,且無法關閉思考模式。若需要視覺輸入或內建工具呼叫,官方建議改用雲端 API 版本 Qwen3.8-Max

Grok 4.6 強化視覺與代理能力

xAI 宣布推出 Grok 4.6 版本。在官方展示中,新版模型在處理多步驟代理任務時,會執行自我驗證機制,在進入下一步驟前先檢查剛生成的結果。 xAI 表示,Grok 4.6 在多項綜合評測中已追平現有前沿模型。定價為每百萬輸入 Token 2 美元、輸出 6 美元,目前已整合至 Cursor 與 Grok Build。

DeepSeek-V4-Pro API 上線

DeepSeek 推出了 V4-Pro 與 V4-Flash 的 API 服務,重點放在代理(Agent)能力的提升。 其 API 端點設計直接相容於 OpenAI 與 Anthropic 格式。開發者只需更改基礎 URL 與 API 金鑰,就能在 Claude Code 或 GitHub Copilot 中串接使用。

Claude 擴充功能升級為 Claude Cowork

Anthropic 將 Chrome 側邊欄更新為 Claude Cowork。更新後,在瀏覽器執行的對話與網頁操作(如讀取內容、填寫表單)會保留上下文,用戶可直接在桌面版或手機版應用程式接續工作。 為防範網頁端的提示詞注入(Prompt Injection),系統導入了雙重審查。一般操作會由獨立系統自動核對是否符合原始指令;若涉及線上購物或分享敏感個資等高風險行為,系統將強制暫停,需由使用者手動點擊確認才會執行。更多安全操作指引可參考 Anthropic 的官方 Safety Guide

Gemini 整合 Ticketmaster 與 Zocdoc 等服務

Google 宣布在 Gemini 中加入更多第三方應用服務。根據官方說明,使用者現在可以直接在 Gemini 的對話介面中呼叫 Ticketmaster 尋找演唱會門票,或使用 Zocdoc 預約看診。

Manus、Grok 與 ChatGPT 的新方案與活動

Cohere 與 LiquidAI 推出輕量級視覺模型

  • Cohere North Micro Vision 2.4B採 Apache 2.0 授權開源。官方表示該模型能保留圖片的原始比例與原生解析度,避免傳統壓縮帶來的細節流失,適合處理文件掃描檔與表單。
  • LiquidAI LFM2.5-VL-3B針對邊緣裝置設計,記憶體佔用約 3 GB。官方測試顯示,該模型在一般手機上的推論速度約為每秒 20 Tokens。

Google DeepMind 將手語 AI 導入 Pixel

Google DeepMind 發布名為 SL2T 的手語翻譯系統,能將使用者的手語即時轉換為英文文字。 為處理隱私疑慮,Pixel 設備僅會在本地端(透過 MediaPipe Holistic 模型)擷取人體骨架特徵點,再將幾何座標回傳至雲端模型進行翻譯,過程中不會上傳原始攝影畫面。

Google 研究:LLM 幻覺多源自「提取失敗」

Google Research 的新論文指出,當 AI 模型給出錯誤事實時,多數情況並非模型未學過該資料。 研究發現,在 GPT-5 或 Gemini-3-Pro 等模型中,高達 95% 至 98% 的事實知識已被編碼於參數內。研究團隊將幻覺比喻為「弄丟鑰匙」而非「書架空無一物」。實驗指出,對於罕見知識,模型在開放式問答容易失敗,但在選擇題表現正常;若在模型中強制加入「思考(Thinking)」步驟,約有 40% 至 65% 原本想不起來的知識能被成功喚醒。

Twitch 預設允許 AI 訓練,引發實況主反彈

Twitch 近期更新政策,預設允許母公司 Amazon 使用實況主的影音內容訓練生成式 AI 模型。若不願授權,實況主必須親自至頻道設定中手動關閉「生成式 AI 訓練」選項。 Twitch 首席產品官 Mike Minton 在官方直播中回應此設計時表示:「如果改成預設關閉(Opt-in),老實說,根本不會有人主動選擇加入。」這段發言在社群中引發了不小的負面聲浪。

LiteLLM 憑證外洩,43 萬 CI/CD 管道面臨風險

安全研究人員指出,LiteLLM 等下游套件遭遇了嚴重的供應鏈攻擊。 事件起因是 Trivy 開發團隊在更換(rotate)憑證時,未完全撤銷已外洩的自動化 Token。這產生了長達 20 天的安全空窗期,讓攻擊者得以強制推送(force-push)惡意程式碼。 該惡意程式碼會讀取受害機器的記憶體,並竊取雲端金鑰或環境變數(如 Salesforce 和 Slack 密鑰)。雖然受感染的 LiteLLM 版本(1.82.7 與 1.82.8)在官方套件庫上僅存活約 40 分鐘,但由於其被廣泛依賴,全球約 43.4 萬個 CI/CD 管道受到波及,包含 Nvidia、AWS、Samsung 等企業皆在影響範圍內。

問與答(Q&A)

Q1:Twitch 實況主如果不希望自己的直播影音被 Amazon 用於 AI 訓練,該如何手動退出(Opt-out)?

  • :實況主必須主動前往個人的頻道設定(而非創作者儀表板),點選「安全與隱私」分頁,接著向下滾動找到「生成式 AI 訓練」(training for generative AI)選項並將其關閉。

Q2:LiteLLM 的供應鏈攻擊是如何發生的?哪些巨頭受到波及,外洩了哪些資料?

  • :這起事件源自 Trivy 開發團隊更換憑證時未完全撤銷外洩的自動化 Token,產生了 20 天的安全空窗期。攻擊者藉此強制推送惡意程式碼,竊取記憶體中的雲端金鑰與環境變數。波及範圍包含 Nvidia、AWS、Samsung、Salesforce 等企業,影響全球約 43.4 萬個 CI/CD 管道。

Q3:Google Research 的最新論文如何顛覆我們對 LLM 「事實錯誤(幻覺)」的傳統認知?

  • :研究指出,前沿模型有高達 95% 至 98% 的事實知識已被編碼在參數中,給出錯誤答案多半是因為「提取失敗」,就像「弄丟了鑰匙」而非「書架是空的」。在模型中強制加入「思考」機制,能有效喚醒 40% 至 65% 的潛在記憶。

Q4:Claude Cowork 在瀏覽器中自動操作網頁,如何防範「提示詞注入(Prompt Injection)」?

  • :Anthropic 引入了雙重審查機制。一般操作會由獨立系統自動核對是否符合原始指令;若涉及「線上購買」或「分享敏感個資」等高風險、不可逆的行為,系統將強制暫停,需由使用者手動點擊確認才會執行。
分享至:
Featured Partners

© 2026 Communeify. All rights reserved.