news

AI 日報|OpenAI 首款自研推論晶片 Jalapeño 實測出爐;蘋果發表 2nm M6 與 M5 Ultra 晶片;IBM 開源 Granite 4.2 推理模型家族

August 26, 2026
Updated Aug 26
5 min read
openai
AI 日報|OpenAI 首款自研推
ibm
ra 晶片;IBM 開源 Gr
ollama
開源協議(Ollama 與 Hug
huggingface
tps://huggingface.co/bl
amp
35B) & Fron
github
tps://github.com/T
news
AI 日報|OpenAI 首款自研推論晶片 Jalapeño 實測出爐;蘋果發表 2nm M6 與 M5 Ultra 晶片;IBM 開源 Granite 4.2 推理模型家族
2026-08-26

AI 日報|OpenAI 首款自研推論晶片 Jalapeño 實測出爐;蘋果發表 2nm M6 與 M5 Ultra 晶片;IBM 開源 Granite 4.2 推理模型家族


模型發布/更新

Granite 4.2 系列推理模型 — IBM

  • 一言以蔽之:IBM 正式開源 Granite 4.2 模型家族(涵蓋 3B、8B 與 30B 引數),旗艦款 30B 原生整合 <think> 思考鏈架構,主打高階企業級推理與靈活思考模式。
  • 核心亮點
    • 三檔彈性思考模式:支援完整思考(Full Thinking)、非思考(Non-thinking)以及低算力思考(Low-effort)模式,允許開發者針對單一查詢在推理深度與延遲消耗間自主權衡。
    • 推理增強工具呼叫與長上下文:具備先思考「呼叫何種工具與原因」再執行 Function Calling 的能力,原生支援 512K 超長上下文視窗,並透過嚴格的企業合規(GRC)資料清洗。
  • 技術規格:3B / 8B / 30B Dense 架構 / 512K Context / Apache 2.0 開源協議(Ollama 與 Hugging Face 同步上架)
  • 傳送門:https://huggingface.co/blog/ibm-granite/granite-4-2

Apodex 1.1 Mini (35B) & FrontierAgent — Apodex

  • 一言以蔽之:由陳天橋主導的 AI 團隊開源 Apodex 1.1 Mini 35B 模型與 FrontierAgent Harness 框架,專為科研、資料分析與非同步多 Agent 協作場景量身打造。
  • 核心亮點
    • 可驗證的任務推進:不同於僅抓取摘要的搜尋工具,Apodex 能直接解析原始檔案(CSV/PDF/圖片/實驗資料),透過自動寫程式碼進行清洗與統計推斷,並產出具備完整執行鏈路與核驗中間檔的交付成果。
    • 非同步多 Agent 協調:可自主將複雜任務拆解並分派給多個 Sub-agent 平行處理,支援人類隨時介入調整執行方向。
  • 技術規格:35B 開放權重 / 開源 Harness 框架 / 支援本機部署
  • 傳送門

Breeze TTS 2 — 開源語音合成競技場登頂

  • 一言以蔽之:Breeze TTS 2 在 Artificial Analysis Provider Voices 語音評測競技場中,以 1,215 的 Elo 評分拿下全球開源權重語音合成模型第一名。
  • 核心亮點
    • 開源領先:在整體榜單中位居第 6,領先 Fish Audio S2 Pro 達 90 分,展現出極具自然度的語調與低延遲生成表現。
  • 技術規格:開源權重 TTS / 語音合成模型
  • 傳送門

WeMM-Embedding (9B / 4B / 2B) — 騰訊

  • 一言以蔽之:騰訊開源基於 Qwen3.5 架構打造的 WeMM-Embedding 通用多模態嵌入模型,原生支援文字、影像、影片與交錯多模態輸入。
  • 核心亮點
    • 統一特徵空間:輸入跨模態資料可直接對映至 4,096 維 L2 正則化向量空間,大幅提升多模態檢索增強生成(RAG)與視覺文件檢索的跨模態匹配精度。
  • 技術規格:2B / 4B / 9B 引數規模 / 4096 維輸出向量 / 開放技術報告與權重
  • 傳送門:https://github.com/Tencent/WeMM-Embedding

產品發布/更新

WebMCP 開放標準與 ChatGPT 桌面端整合 — OpenAI

  • 一言以蔽之:OpenAI 推出實驗性開放標準 WebMCP,允許 Web 應用直接向 AI Agent 暴露工具介面,並已全面整合至 ChatGPT 桌面端內建瀏覽器與 ChatGPT Sites。
  • 核心亮點
    • 瀏覽器原生 Agent 互動:當使用者造訪支援 WebMCP 的網站時,ChatGPT 或 Codex 能直接在頁面內呼叫工具完成表單填寫、資料比對等操作。
    • 生態挑戰賽開跑:聯手 Vercel、Cloudflare、Shopify 與 Chromium 團隊展開為期 10 天的 WebMCP 駭客松,加速 Web 應用的 Agent 化標準落地。
  • 適用人群:Web 開發者 / 全端工程師 / Agent 開發者
  • 體驗通道

跨 Chat 與 Cowork 統一記憶管理 — Anthropic (Claude)

  • 一言以蔽之:Claude 推出跨聊天介面與 Claude Cowork 的統一記憶系統,讓 Agent 能跨工作流共用上下文,並提供完整的主題式記憶編輯介面。
  • 核心亮點
    • 無縫上下文承接:在 Chat 中討論過的專案背景、主管偏好或客戶需求,切換至 Cowork 執行自動化任務時無需重複提示即可直接呼叫。
    • 細粒度隱私控制:使用者可在設定中的記憶瀏覽器逐條檢視、修改或刪除記憶主題;信仰、健康等敏感資訊預設不儲存,並提供獨立開關。
  • 適用人群:Claude Pro / Max 使用者 / 知識工作者 / 專案經理
  • 體驗通道:https://claude.com/blog/claudes-memory-works-everywhere-and-you-decide-whats-in-it

Portable Computer 本機 Agent 堆疊 — Perplexity × NVIDIA

  • 一言以蔽之:Perplexity 推出專為 NVIDIA DGX Spark 設計的完全本機化 Agent 系統「Portable Computer」,從協調模型、子 Agent 到 Harness 全數執行於本機硬體。
  • 核心亮點
    • 零雲端隱私保護:執行 post-training 微調的本機 PPLX 27B 模型,敏感檔案解析(ParseBench-100 達 65.1%)完全不離開裝置,僅聯網搜尋時向外請求。
    • 智慧向上升級機制:在遭遇極高難度任務時,支援以使用者確認、PII 過濾的純文字提示方式向上請求雲端前沿模型指導(Terminal Bench 2.1 評分自 59.6% 提升至 73.0%)。
  • 適用人群:高隱私要求的企業使用者 / 研發團隊 / DGX Spark 使用者
  • 體驗通道

豆包工作 (Doubao Work) — 位元組跳動 (ByteDance)

  • 一言以蔽之:位元組跳動推出全新獨立 AI 辦公客戶端「豆包工作」,深度整合飛書會議、檔案與通訊錄等組織上下文,提供一體化的企業級 Agent 辦公體驗。
  • 核心亮點
    • 全組織上下文注入:自動彙整飛書群組討論、會議紀錄與知識庫,能主動提醒待辦事項、操作行事曆並協助多維表格資料處理。
    • Windows Computer Use 與雲電腦協同:針對 Windows 系統辦公軟體深入最佳化,支援檔案/簡報生成、網頁快速搭建與區域性視覺化標註修改。
  • 適用人群:飛書企業使用者 / 辦公族 / 跨部門專案管理人員
  • 體驗通道:https://doubao.com/work

Vercel Connect GA 與 Run SDK — Vercel

  • 一言以蔽之:Vercel Connect 正式邁入 GA,徹底廢除長效金鑰憑證擴散,並同步推出 Run SDK 用於在隔離沙盒中安全評估與執行 Agent 生成的程式碼。
  • 核心亮點
    • 短期動態憑證:透過 Vercel OIDC 身份認證,在執行期依據任務動態取得短時效、限定許可權範圍的 Access Token,預置支援超過 100 款聯結器(Slack、GitHub、Linear 等)。
    • QuickJS 隔離執行:Run SDK 在 Worker 執行緒中建立嶄新的 QuickJS 上下文執行未受信任的 TypeScript/JavaScript,並支援中斷點以供人類審批(HITL)。
  • 適用人群:全端開發者 / 安全架構師 / Agent 平臺開發團隊
  • 體驗通道:https://vercel.com/blog/the-end-of-credential-sprawl-for-agents

Composer 分段音樂創作編輯器 — ElevenLabs

  • 一言以蔽之:ElevenLabs 旗下 ElevenMusic 推出分段音樂編輯器 Composer,支援創作者針對歌曲各段落進行結構重組與細部調整。
  • 核心亮點
    • 結構化樂段編輯:基於 Music v2 模型,創作者可自由調換橋段(Bridge)、副歌(Chorus)或結尾(Outro),並對單一樂段的時長、速度(Tempo)與調性(Key)進行精確調整。
  • 適用人群:音樂製作人 / 影音創作者 / 聲音設計師
  • 體驗通道

產業動態

OpenAI 自研推論晶片「Jalapeño」首發效能出爐 — OpenAI

  • 事件概述:OpenAI 首次公開自研推論晶片 Jalapeño 的實測基準資料。在公開評測基準 InferenceX(使用 GPT-OSS 120B)中,Jalapeño 每千瓦輸出的峰值 Token 吞吐量較目前商用系統提升最高達 1.9 倍,延遲降低最高 3.6 倍,並在 DeepSeek R1 與 Kimi K2 模型上展現跨架構優勢。該晶片在 AI 工具輔助下僅用 9 個月即完成設計到流片,預計於今年底開始部署於 OpenAI 資料中心。
  • 影響分析:隨著前沿實驗室大舉跨入自研特殊應用晶片(ASIC),超大型推論叢集的每瓦能效將顯著改善,加速長思考鏈(CoT)與高並發 Agent 任務的邊際成本下降。
  • 新聞連結:https://openai.com/index/jalapeno-first-results

Apple 發布首款 2nm M6 與四晶片封裝 M5 Ultra 晶片 — Apple

  • 事件概述:Apple 正式推出首款採用 2 奈米製程的 M6 晶片,配備 12 核心 CPU、12 核心 GPU(每個 GPU 核心均內建神經加速器)與雙 16 核神經網路引擎,AI 圖形運算較 M5 提升 30%;同步發布的 M5 Ultra 採用全新四晶片封裝架構,支援最高 512GB 統一記憶體與 1.2TB/s 記憶體頻寬,分別搭載於新款 Mac mini 與 Mac Studio。
  • 影響分析:高達 512GB 的超高頻寬統一記憶體,讓開發者得以在個人工作站本機完整載入並執行數千億引數的前沿 LLM,進一步強化 Mac 作為邊緣端 AI 本機開發旗艦裝置的地位。
  • 新聞連結:https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute

ChatGPT 推出 100 美元 Business Premium 席位方案 — OpenAI

  • 事件概述:OpenAI 針對中小型企業與新創團隊推出每月 100 美元的 Business Premium 席位方案,全面解除 5 小時的使用頻率限制,並提供比照 Pro 方案的運算額度與專屬管理員外掛模組。
  • 影響分析:填補了標準 Team 方案與高階 Enterprise 方案之間的真空帶,讓高強度依賴 Codex 與 Agent 工作流的精簡團隊能以可預測的成本獲取充足算力。
  • 新聞連結

TeraFab 得州半導體超級設施二、三期協議簽署 — SpaceX / Tesla / xAI

  • 事件概述:由 SpaceX 主導、聯合 Tesla 與 xAI 的 TeraFab 垂直整合半導體基地正式與得州簽署二期與三期協議,合計投資金額約 476.77 億美元,規劃於 2029 至 2034 年間分階段投產,四期總投資規模預計達 1,190 億美元。
  • 影響分析:展現了馬斯克生態系整合航太、自動駕駛與前沿 AI 晶片自主製造供應鏈的龐大野心,旨在降低對外部晶圓代工廠的地緣政治依賴。
  • 新聞連結

論文研究

AgentHands:XR 空間對話 Agent 的同步手勢生成系統 — Google Research (CHI 2026)

  • 研究動機:現有延展實境(XR)對話 Agent 往往缺乏與語音精準同步且符合空間環境的物理指引肢體動作。
  • 核心創新:透過眼動追蹤與三維場景重建進行實體物體定位,由大型語言模型在對話生成中嵌入 GestureEvents 事件標籤,並在頭戴裝置端按照詞級(Word-level)時間戳協調 TTS 語音引擎與動畫渲染引擎。
  • 研究成果:在園藝教學、3D 列印機操作講解與生活陪伴原型測試中,展現出高度擬真且空間錨定精準的手勢語音同步效果。
  • 論文地址:https://research.google/blog/agenthands-generating-interactive-hand-gestures-for-spatially-grounded-agent-conversations-in-xr

評測框架非中立性研究:配置微調導致模型跑分劇烈震盪 — DAIR.AI / 研究團隊

  • 研究動機:探討評測框架(Harness)中的非語意性微小配置對模型排行榜排名的真實幹擾程度。
  • 核心創新:針對 12 款開源模型在 ARC、HellaSwag、MMLU 等資料集上的 3,679 道題目,在 26 種同等合理的 Harness 配置下進行交叉測試(僅調整選項順序、提示詞措辭與答案解析正則)。
  • 研究成果:研究發現同一模型(如 Gemma 4-31B)的得分可在 31% 到 89% 之間劇烈波動,相鄰模型間 95.7% 的分數差距僅源自題目對配置的敏感性,揭示現行基準壓縮與榜單排名存在極大的脆弱性。
  • 論文地址

AutoSaddler:基於執行軌跡自動修補 Agent Harness 的離線最佳化框架 — 微軟研究團隊

  • 研究動機:目前多數 Agent Harness 的提示詞、工具介面與控制邏輯高度依賴工程師手動微調,缺乏自動化系統性迭代機制。
  • 核心創新:提出 AutoSaddler 框架,將 Harness 本身視為程式碼,透過批次執行任務診斷失敗軌跡,自動合成結構化的修補程式(Patch),並僅在透過泛化驗證集時才予以保留。
  • 研究成果:在 GAIA2 基準測試上提升 9.0 分、SWE-Bench Pro 提升 9.6 分、Terminal-Bench 2.0 提升 10.0 分,證明針對性程式碼修補顯著優於淺層的自我反思(Reflection)。
  • 論文地址:https://arxiv.org/abs/2608.23041

Knowledge Triage:解決 Context 壓縮中安全規則與規範丟失問題 — 研究團隊

  • 研究動機:當 Agent 長程執行的 Context 溢位時,傳統壓縮演演演算法會無差別地壓縮所有內容,導致存放在 AGENTS.mdCLAUDE.md 中的安全規則與規範在多輪對話後迅速失效(5 輪後留存率跌至 10%)。
  • 核心創新:提出 Knowledge Triage 機制,將知識庫內容按型別分類並套用差異化的保留策略,結合壓縮、分割槽與檢索三組確定性運算元進行排程。
  • 研究成果:在歷經 5 輪 Context 壓縮後仍能維持 96% 的安全規則召回率,較傳統方案保留多達 2 至 4 倍的關鍵規範約束。
  • 論文地址:https://arxiv.org/abs/2608.22752

其他分享

Pipette:邊緣端模型、量化與硬體全鏈路可複現評測套件 — Liquid AI

  • 內容簡介:Liquid AI 與 Artificial Analysis 合作開源評測套件 Pipette。該工具以「模型 + 量化演演演算法 + 執行期(Runtime)+ 硬體裝置」整體組合為最小評測單位,解決了過往邊緣端 AI 在不同晶片與量化精度下效能資料難以對齊比較的痛點。
  • 傳送門:https://www.marktechpost.com/2026/08/25/liquid-ai-open-sources-pipette-a-reproducible-benchmarking-suite-that-measures-on-device-models-quantization-runtime-and-hardware-together

Thermo-Nuclear Code Review:極致簡約的 Agent 程式碼審查規則 — 社群精選

  • 內容簡介:社群分享了一套專為 Cursor 等程式碼 Agent 設計的高標準審查 Skill。該規則要求 Agent 優先尋找能直接消除冗餘分支與 helper 的重構方案、嚴格遵守 1,000 行程式碼紅線上限,並杜絕插入臨時布林標記等「義大利麵式增長」,適合用於追求極致乾淨架構的新專案中。
  • 傳送門
分享至:
Featured Partners

© 2026 Communeify. All rights reserved.