AI 日報|OpenAI 首款自研推論晶片 Jalapeño 實測出爐;蘋果發表 2nm M6 與 M5 Ultra 晶片;IBM 開源 Granite 4.2 推理模型家族
模型發布/更新
Granite 4.2 系列推理模型 — IBM
- 一言以蔽之:IBM 正式開源 Granite 4.2 模型家族(涵蓋 3B、8B 與 30B 引數),旗艦款 30B 原生整合
<think>思考鏈架構,主打高階企業級推理與靈活思考模式。 - 核心亮點:
- 三檔彈性思考模式:支援完整思考(Full Thinking)、非思考(Non-thinking)以及低算力思考(Low-effort)模式,允許開發者針對單一查詢在推理深度與延遲消耗間自主權衡。
- 推理增強工具呼叫與長上下文:具備先思考「呼叫何種工具與原因」再執行 Function Calling 的能力,原生支援 512K 超長上下文視窗,並透過嚴格的企業合規(GRC)資料清洗。
- 技術規格:3B / 8B / 30B Dense 架構 / 512K Context / Apache 2.0 開源協議(Ollama 與 Hugging Face 同步上架)
- 傳送門:https://huggingface.co/blog/ibm-granite/granite-4-2
Apodex 1.1 Mini (35B) & FrontierAgent — Apodex
- 一言以蔽之:由陳天橋主導的 AI 團隊開源 Apodex 1.1 Mini 35B 模型與 FrontierAgent Harness 框架,專為科研、資料分析與非同步多 Agent 協作場景量身打造。
- 核心亮點:
- 可驗證的任務推進:不同於僅抓取摘要的搜尋工具,Apodex 能直接解析原始檔案(CSV/PDF/圖片/實驗資料),透過自動寫程式碼進行清洗與統計推斷,並產出具備完整執行鏈路與核驗中間檔的交付成果。
- 非同步多 Agent 協調:可自主將複雜任務拆解並分派給多個 Sub-agent 平行處理,支援人類隨時介入調整執行方向。
- 技術規格:35B 開放權重 / 開源 Harness 框架 / 支援本機部署
- 傳送門:
前几天内测,发现这个产品的深度搜索能力超强。
— 向阳乔木 (@vista8) August 25, 2026
不止搜索,还会写代码、多Agent组合完成复杂任务。
今天刷屏后才知道 Apodex 是一家由陈天桥出资创立并亲自主导的公司。
前几天在上海见了很多优秀的朋友,很多都在盛大创新院待过,果然是互联网黄埔军校。
这次不仅发布 Apodex 1.1 mini 35b… https://t.co/G8qyJBJ8Q3
Breeze TTS 2 — 開源語音合成競技場登頂
- 一言以蔽之:Breeze TTS 2 在 Artificial Analysis Provider Voices 語音評測競技場中,以 1,215 的 Elo 評分拿下全球開源權重語音合成模型第一名。
- 核心亮點:
- 開源領先:在整體榜單中位居第 6,領先 Fish Audio S2 Pro 達 90 分,展現出極具自然度的語調與低延遲生成表現。
- 技術規格:開源權重 TTS / 語音合成模型
- 傳送門:
Breeze TTS 2 is now the leading Open Weights TTS model in the Artificial Analysis Provider Voices Speech Arena, surpassing Fish Audio S2 Pro by 90 Elo points
— Artificial Analysis (@ArtificialAnlys) August 25, 2026
Breeze TTS 2 is the latest TTS model from @BreezeBlueX, supporting 50 languages, voice generation from text prompts, and… pic.twitter.com/LWKaENo6DF
WeMM-Embedding (9B / 4B / 2B) — 騰訊
- 一言以蔽之:騰訊開源基於 Qwen3.5 架構打造的 WeMM-Embedding 通用多模態嵌入模型,原生支援文字、影像、影片與交錯多模態輸入。
- 核心亮點:
- 統一特徵空間:輸入跨模態資料可直接對映至 4,096 維 L2 正則化向量空間,大幅提升多模態檢索增強生成(RAG)與視覺文件檢索的跨模態匹配精度。
- 技術規格:2B / 4B / 9B 引數規模 / 4096 維輸出向量 / 開放技術報告與權重
- 傳送門:https://github.com/Tencent/WeMM-Embedding
產品發布/更新
WebMCP 開放標準與 ChatGPT 桌面端整合 — OpenAI
- 一言以蔽之:OpenAI 推出實驗性開放標準 WebMCP,允許 Web 應用直接向 AI Agent 暴露工具介面,並已全面整合至 ChatGPT 桌面端內建瀏覽器與 ChatGPT Sites。
- 核心亮點:
- 瀏覽器原生 Agent 互動:當使用者造訪支援 WebMCP 的網站時,ChatGPT 或 Codex 能直接在頁面內呼叫工具完成表單填寫、資料比對等操作。
- 生態挑戰賽開跑:聯手 Vercel、Cloudflare、Shopify 與 Chromium 團隊展開為期 10 天的 WebMCP 駭客松,加速 Web 應用的 Agent 化標準落地。
- 適用人群:Web 開發者 / 全端工程師 / Agent 開發者
- 體驗通道:
We’re adding support for WebMCP in the ChatGPT desktop app’s built-in browser and ChatGPT Sites.
— OpenAI Developers (@OpenAIDevs) August 25, 2026
When you visit a compatible website, ChatGPT or Codex can automatically use it to complete your task.
Update to the latest version of the ChatGPT desktop app, then just ask Codex to… pic.twitter.com/XCGXUTRotN
跨 Chat 與 Cowork 統一記憶管理 — Anthropic (Claude)
- 一言以蔽之:Claude 推出跨聊天介面與 Claude Cowork 的統一記憶系統,讓 Agent 能跨工作流共用上下文,並提供完整的主題式記憶編輯介面。
- 核心亮點:
- 無縫上下文承接:在 Chat 中討論過的專案背景、主管偏好或客戶需求,切換至 Cowork 執行自動化任務時無需重複提示即可直接呼叫。
- 細粒度隱私控制:使用者可在設定中的記憶瀏覽器逐條檢視、修改或刪除記憶主題;信仰、健康等敏感資訊預設不儲存,並提供獨立開關。
- 適用人群:Claude Pro / Max 使用者 / 知識工作者 / 專案經理
- 體驗通道:https://claude.com/blog/claudes-memory-works-everywhere-and-you-decide-whats-in-it
Portable Computer 本機 Agent 堆疊 — Perplexity × NVIDIA
- 一言以蔽之:Perplexity 推出專為 NVIDIA DGX Spark 設計的完全本機化 Agent 系統「Portable Computer」,從協調模型、子 Agent 到 Harness 全數執行於本機硬體。
- 核心亮點:
- 零雲端隱私保護:執行 post-training 微調的本機 PPLX 27B 模型,敏感檔案解析(ParseBench-100 達 65.1%)完全不離開裝置,僅聯網搜尋時向外請求。
- 智慧向上升級機制:在遭遇極高難度任務時,支援以使用者確認、PII 過濾的純文字提示方式向上請求雲端前沿模型指導(Terminal Bench 2.1 評分自 59.6% 提升至 73.0%)。
- 適用人群:高隱私要求的企業使用者 / 研發團隊 / DGX Spark 使用者
- 體驗通道:
Today we’re launching Portable Computer on @NVIDIA DGX Spark.
— Perplexity (@perplexity_ai) August 25, 2026
Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency. pic.twitter.com/plVWz5PaAw
豆包工作 (Doubao Work) — 位元組跳動 (ByteDance)
- 一言以蔽之:位元組跳動推出全新獨立 AI 辦公客戶端「豆包工作」,深度整合飛書會議、檔案與通訊錄等組織上下文,提供一體化的企業級 Agent 辦公體驗。
- 核心亮點:
- 全組織上下文注入:自動彙整飛書群組討論、會議紀錄與知識庫,能主動提醒待辦事項、操作行事曆並協助多維表格資料處理。
- Windows Computer Use 與雲電腦協同:針對 Windows 系統辦公軟體深入最佳化,支援檔案/簡報生成、網頁快速搭建與區域性視覺化標註修改。
- 適用人群:飛書企業使用者 / 辦公族 / 跨部門專案管理人員
- 體驗通道:https://doubao.com/work
Vercel Connect GA 與 Run SDK — Vercel
- 一言以蔽之:Vercel Connect 正式邁入 GA,徹底廢除長效金鑰憑證擴散,並同步推出 Run SDK 用於在隔離沙盒中安全評估與執行 Agent 生成的程式碼。
- 核心亮點:
- 短期動態憑證:透過 Vercel OIDC 身份認證,在執行期依據任務動態取得短時效、限定許可權範圍的 Access Token,預置支援超過 100 款聯結器(Slack、GitHub、Linear 等)。
- QuickJS 隔離執行:Run SDK 在 Worker 執行緒中建立嶄新的 QuickJS 上下文執行未受信任的 TypeScript/JavaScript,並支援中斷點以供人類審批(HITL)。
- 適用人群:全端開發者 / 安全架構師 / Agent 平臺開發團隊
- 體驗通道:https://vercel.com/blog/the-end-of-credential-sprawl-for-agents
Composer 分段音樂創作編輯器 — ElevenLabs
- 一言以蔽之:ElevenLabs 旗下 ElevenMusic 推出分段音樂編輯器 Composer,支援創作者針對歌曲各段落進行結構重組與細部調整。
- 核心亮點:
- 結構化樂段編輯:基於 Music v2 模型,創作者可自由調換橋段(Bridge)、副歌(Chorus)或結尾(Outro),並對單一樂段的時長、速度(Tempo)與調性(Key)進行精確調整。
- 適用人群:音樂製作人 / 影音創作者 / 聲音設計師
- 體驗通道:
Introducing Composer, a section-by-section song editor.
— ElevenLabs (@ElevenLabs) August 25, 2026
Start with your own lyrics or track, a blank page, or a prompt, then shape the track piece by piece until it’s finished. pic.twitter.com/4xvWg5UhNr
產業動態
OpenAI 自研推論晶片「Jalapeño」首發效能出爐 — OpenAI
- 事件概述:OpenAI 首次公開自研推論晶片 Jalapeño 的實測基準資料。在公開評測基準 InferenceX(使用 GPT-OSS 120B)中,Jalapeño 每千瓦輸出的峰值 Token 吞吐量較目前商用系統提升最高達 1.9 倍,延遲降低最高 3.6 倍,並在 DeepSeek R1 與 Kimi K2 模型上展現跨架構優勢。該晶片在 AI 工具輔助下僅用 9 個月即完成設計到流片,預計於今年底開始部署於 OpenAI 資料中心。
- 影響分析:隨著前沿實驗室大舉跨入自研特殊應用晶片(ASIC),超大型推論叢集的每瓦能效將顯著改善,加速長思考鏈(CoT)與高並發 Agent 任務的邊際成本下降。
- 新聞連結:https://openai.com/index/jalapeno-first-results
Apple 發布首款 2nm M6 與四晶片封裝 M5 Ultra 晶片 — Apple
- 事件概述:Apple 正式推出首款採用 2 奈米製程的 M6 晶片,配備 12 核心 CPU、12 核心 GPU(每個 GPU 核心均內建神經加速器)與雙 16 核神經網路引擎,AI 圖形運算較 M5 提升 30%;同步發布的 M5 Ultra 採用全新四晶片封裝架構,支援最高 512GB 統一記憶體與 1.2TB/s 記憶體頻寬,分別搭載於新款 Mac mini 與 Mac Studio。
- 影響分析:高達 512GB 的超高頻寬統一記憶體,讓開發者得以在個人工作站本機完整載入並執行數千億引數的前沿 LLM,進一步強化 Mac 作為邊緣端 AI 本機開發旗艦裝置的地位。
- 新聞連結:https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute
ChatGPT 推出 100 美元 Business Premium 席位方案 — OpenAI
- 事件概述:OpenAI 針對中小型企業與新創團隊推出每月 100 美元的 Business Premium 席位方案,全面解除 5 小時的使用頻率限制,並提供比照 Pro 方案的運算額度與專屬管理員外掛模組。
- 影響分析:填補了標準 Team 方案與高階 Enterprise 方案之間的真空帶,讓高強度依賴 Codex 與 Agent 工作流的精簡團隊能以可預測的成本獲取充足算力。
- 新聞連結:
Introducing ChatGPT Business Premium Seats
— OpenAI (@OpenAI) August 25, 2026
The new $100 Premium seat is a game changer for small businesses and startups—giving lean teams better tools, faster workflows, and capabilities once reserved for big companies.
A flexible plan that scales with your team’s ambition.… pic.twitter.com/BsR2phYfc9
TeraFab 得州半導體超級設施二、三期協議簽署 — SpaceX / Tesla / xAI
- 事件概述:由 SpaceX 主導、聯合 Tesla 與 xAI 的 TeraFab 垂直整合半導體基地正式與得州簽署二期與三期協議,合計投資金額約 476.77 億美元,規劃於 2029 至 2034 年間分階段投產,四期總投資規模預計達 1,190 億美元。
- 影響分析:展現了馬斯克生態系整合航太、自動駕駛與前沿 AI 晶片自主製造供應鏈的龐大野心,旨在降低對外部晶圓代工廠的地緣政治依賴。
- 新聞連結:
BREAKING: TeraFab secures two major Texas agreements for Phases 2 and 3, representing nearly $48 billion in investment.
— DogeDesigner (@cb_doge) August 25, 2026
The previously announced $16.8 billion figure applied only to TeraFab’s initial Phase 1. These new agreements cover the Anderson-Shiro portions of the next two… pic.twitter.com/IMFeImzrb2
論文研究
AgentHands:XR 空間對話 Agent 的同步手勢生成系統 — Google Research (CHI 2026)
- 研究動機:現有延展實境(XR)對話 Agent 往往缺乏與語音精準同步且符合空間環境的物理指引肢體動作。
- 核心創新:透過眼動追蹤與三維場景重建進行實體物體定位,由大型語言模型在對話生成中嵌入 GestureEvents 事件標籤,並在頭戴裝置端按照詞級(Word-level)時間戳協調 TTS 語音引擎與動畫渲染引擎。
- 研究成果:在園藝教學、3D 列印機操作講解與生活陪伴原型測試中,展現出高度擬真且空間錨定精準的手勢語音同步效果。
- 論文地址:https://research.google/blog/agenthands-generating-interactive-hand-gestures-for-spatially-grounded-agent-conversations-in-xr
評測框架非中立性研究:配置微調導致模型跑分劇烈震盪 — DAIR.AI / 研究團隊
- 研究動機:探討評測框架(Harness)中的非語意性微小配置對模型排行榜排名的真實幹擾程度。
- 核心創新:針對 12 款開源模型在 ARC、HellaSwag、MMLU 等資料集上的 3,679 道題目,在 26 種同等合理的 Harness 配置下進行交叉測試(僅調整選項順序、提示詞措辭與答案解析正則)。
- 研究成果:研究發現同一模型(如 Gemma 4-31B)的得分可在 31% 到 89% 之間劇烈波動,相鄰模型間 95.7% 的分數差距僅源自題目對配置的敏感性,揭示現行基準壓縮與榜單排名存在極大的脆弱性。
- 論文地址:
Great paper on agent harnesses. https://t.co/lsS4eKFGWs
— elvis (@omarsar0) August 25, 2026
AutoSaddler:基於執行軌跡自動修補 Agent Harness 的離線最佳化框架 — 微軟研究團隊
- 研究動機:目前多數 Agent Harness 的提示詞、工具介面與控制邏輯高度依賴工程師手動微調,缺乏自動化系統性迭代機制。
- 核心創新:提出 AutoSaddler 框架,將 Harness 本身視為程式碼,透過批次執行任務診斷失敗軌跡,自動合成結構化的修補程式(Patch),並僅在透過泛化驗證集時才予以保留。
- 研究成果:在 GAIA2 基準測試上提升 9.0 分、SWE-Bench Pro 提升 9.6 分、Terminal-Bench 2.0 提升 10.0 分,證明針對性程式碼修補顯著優於淺層的自我反思(Reflection)。
- 論文地址:https://arxiv.org/abs/2608.23041
Knowledge Triage:解決 Context 壓縮中安全規則與規範丟失問題 — 研究團隊
- 研究動機:當 Agent 長程執行的 Context 溢位時,傳統壓縮演演演算法會無差別地壓縮所有內容,導致存放在
AGENTS.md或CLAUDE.md中的安全規則與規範在多輪對話後迅速失效(5 輪後留存率跌至 10%)。 - 核心創新:提出 Knowledge Triage 機制,將知識庫內容按型別分類並套用差異化的保留策略,結合壓縮、分割槽與檢索三組確定性運算元進行排程。
- 研究成果:在歷經 5 輪 Context 壓縮後仍能維持 96% 的安全規則召回率,較傳統方案保留多達 2 至 4 倍的關鍵規範約束。
- 論文地址:https://arxiv.org/abs/2608.22752
其他分享
Pipette:邊緣端模型、量化與硬體全鏈路可複現評測套件 — Liquid AI
- 內容簡介:Liquid AI 與 Artificial Analysis 合作開源評測套件 Pipette。該工具以「模型 + 量化演演演算法 + 執行期(Runtime)+ 硬體裝置」整體組合為最小評測單位,解決了過往邊緣端 AI 在不同晶片與量化精度下效能資料難以對齊比較的痛點。
- 傳送門:https://www.marktechpost.com/2026/08/25/liquid-ai-open-sources-pipette-a-reproducible-benchmarking-suite-that-measures-on-device-models-quantization-runtime-and-hardware-together
Thermo-Nuclear Code Review:極致簡約的 Agent 程式碼審查規則 — 社群精選
- 內容簡介:社群分享了一套專為 Cursor 等程式碼 Agent 設計的高標準審查 Skill。該規則要求 Agent 優先尋找能直接消除冗餘分支與 helper 的重構方案、嚴格遵守 1,000 行程式碼紅線上限,並杜絕插入臨時布林標記等「義大利麵式增長」,適合用於追求極致乾淨架構的新專案中。
- 傳送門:
昨天看到一个变态的 Code Review skills 应该是 Cursor 官方一个非常严格的代码质量审查技能。Thermo-Nuclear Code Quality Review 热核级别代码审查....https://t.co/67J1tOm9FE
— Viking (@vikingmute) August 25, 2026
里面的 rule 翻译一下是这样的:
结构简化优先: 要主动找能让整段分支、helper、mode、条件判断直接消失的重构方案…



