AI 日報|Google 發布 Ge
le 發布 Gemini 3.8 L
fy 攜手 OpenAI 上線 Ch
oogle DeepMind 一言以蔽之
官方公告 Grok Build
憶功能 — xAI 更新內容:
news
AI 日報|Google 發布 Gemini 3.8 Live 語音模型;TypeSafe AI 推出全新 System One 模型 Jev;Shopify 攜手 OpenAI 上線 ChatGPT Ads
2026-09-18
AI 日報|Google 發布 Gemini 3.8 Live 語音模型;TypeSafe AI 推出全新 System One 模型 Jev;Shopify 攜手 OpenAI 上線 ChatGPT Ads
模型發布/更新
Gemini 3.8 Live 與 Extended Thinking — Google DeepMind
- 一言以蔽之:Google 推出全新 Gemini 3.8 Live 語音模型,同步帶來支援多步驟深度推理的 Extended Thinking 版本,實現「邊想邊說」的即時語音互動。
- 核心亮點:
- 即時思考與發音同步:Extended Thinking 版本在面對複雜問題時,會自然發出「讓我想一下…」等過渡語,並在背景執行多步驟任務時同步向使用者回報進度。
- 非同步工具呼叫:支援在背景呼叫外部 API、檢索資料或執行複雜計算的同時,前端語音互動完全不中斷。
- 技術規格:支援 97 種語言自動切換 / 語音對話綜合評測第一梯隊
- 傳送門:Google 官方部落格
Jev (System One 模型) — TypeSafe AI
- 一言以蔽之:由 ChatGPT 聯合創辦人 Diogo Almeida 創辦的 TypeSafe AI 推出全新類別的「System One 模型」Jev,完全放棄文字生成,專門為軟體內部的高速決策與路由設計。
- 核心亮點:
- 平行決策架構:放棄傳統大模型的逐字序列生成,改以平行取樣一次算出所有結構化答案,速度比前沿大模型快上數十甚至數百倍。
- 型別安全與校準機率:輸入非結構化資料,直接輸出帶有機率值的結構化選擇(Choice)、評分(Score)與布林值(Boolean),大幅降低應用程式解析成本。
- 技術規格:專用決策模型 / 支援 AI SDK / 延遲僅 70 至 500 毫秒
- 傳送門:TypeSafe AI 官方部落格
Mimo-v2.6-Pro — 小米
- 一言以蔽之:小米持續推進 Mimo 系列大模型訓練,其最新 2.6 Pro 版本在 Agentic RL(AI Agent 強化學習)後訓練中展現出色的多源交叉驗證與程式碼修復能力。
- 核心亮點:
- 多源交叉驗證能力:強化了複雜投研與資料核驗任務中的背景追溯,能呼叫數百個子代理進行網頁交叉比對,大幅減少幻覺。
- 大型專案除錯表現:在大型開源程式碼庫測試中表現亮眼,跨檔案修改與修復能力顯著提升。
- 技術規格:開源/閉源混合架構 / 支援大規模非同步 RL 訓練
- 傳送門:小米 Mimo 訓練儀表盤
產品發布/更新
ChatGPT Ads 與 Sponsored Agents — OpenAI / Shopify
- 更新內容:OpenAI 與 Shopify 達成重大商業合作,正式在 Shopify 後臺與 ChatGPT Ads 平臺上線「Sponsored Agents(贊助 AI Agent)」功能。商家可直接從 Shopify Catalog 拉取商品資料並免費設定廣告活動,使用者在 ChatGPT 內點選相關廣告後,可直接與標記清晰的商業贊助 AI Agent 進行互動與完成導購,開啟 AI 導向的代理式商務新浪潮。
- 適用人群:[電商商家 / 數位行銷人員 / AI 應用開發者]
- 體驗通道:OpenAI 官方公告
Grok Build 記憶功能 — xAI
- 更新內容:xAI 宣佈 Grok Build 平臺正式上線長期記憶功能。系統會在每輪對話結束後,自動在背景記錄專案約定、業務決策及關鍵事實,供後續所有會話讀取。使用者可透過
/memory指令唯讀瀏覽記憶檔案,或透過/dream指令將雜亂筆記自動整理為主題檔案,大幅提升長期開發與協作的連貫性。 - 適用人群:[軟體開發者 / 專案經理 / Grok 深度使用者]
- 體驗通道:xAI 官方新聞稿
產業動態
Databricks 向全公司 3500 名工程師全面部署 Astra
- 事件概述:大資料與雲端巨頭 Databricks 宣佈,已將 OpenAI 的高階模型 Astra 部署給全公司約 3,500 名工程師使用。此前經過 200 人的小規模試點顯示,Astra 在高層系統設計等高複雜度工程任務上,明確超越此前的主流前沿模型。
- 影響分析:顯示頂尖企業正快速將前沿 AI 代理深度嵌入核心研發流程,儘管工程支出有所上升,但生產力與系統設計的效益已獲得大型企業的高度認可。
- 新聞連結:
wall-to-wall deployment of astra for engineers at databricks: https://t.co/yJmKV581Rd
— Greg Brockman (@gdb) September 16, 2026
AI 新創 Arcee.ai 完成 B 輪融資,估值正式突破 10 億美元
- 事件概述:開源模型平臺 Arcee.ai 宣佈完成最新 B 輪融資,公司估值正式跨過 10 億美元大關。此輪融資由 Vista Equity Partners 領投,資金將用於加速其次世代 Trinity 開源模型的研發,並擴大與美國能源部及國家實驗室在 Genesis-Science-1 專案上的合作。
- 影響分析:在資本市場對基礎設施與開源企業級平臺高度需求的推動下,主打企業自建與開源營運的 AI 新創正迅速步入獨角獸行列。
- 新聞連結:
BOOOOOOOM 🔥 https://t.co/Z0NIRuCMYB
— Julien Chaumond (@julien_c) September 16, 2026
論文研究
The Last AI Built by Humans: 評估 AI 自我改進的五級框架 — 位元組跳動 / 清華大學 / 上海人工智慧實驗室等 30+ 機構 (ArXiv 2609.11873)
- 研究動機:面對前沿實驗室紛紛加速走向自主研發與自我改進(Self-Improvement),學術界急需一套客觀且具系統性的分類標準來衡量 AI 的自主演進能力。
- 核心創新:提出一套涵蓋 5 個級別的 AI 自我改進評估框架。從 Level 1(人類決定修改內容)到 Level 5(AI 自行重寫創造下一代 AI 的過程),並對 491 篇現有論文進行了全面分級梳理。
- 研究成果:分析發現目前 75% 的研究仍停留在 Level 1 至 Level 2,而真正達到 Level 5 最高階別的比例不到 6%,為全球 AI 治理與安全監管提供了重要的量化基準。
- 論文地址:ArXiv 論文連結
Multi-Model Systems for Hard Science Benchmarks — NVIDIA Research (ArXiv 2609.17306)
- 研究動機:在建構多 AI Agent 系統(Multi-Agent System)時,開發者往往面臨「應該混合多種不同模型,還是使用單一模型多個例項」的抉擇,過去缺乏嚴謹的實證分析。
- 核心創新:NVIDIA 研究團隊針對 8 種模型選擇策略進行了大規模對比,涵蓋模型規模、準確度、答案多樣性與錯誤多樣性,並在艱難的科學基準測試上進行評估。
- 研究成果:研究發現,混合不同模型往往會導致效能低於最佳單一模型;相對地,採用同一模型家族的多個例項或多數決投票(如將 HLE 準確度從 29.4% 提升至 32.2%)效果更佳。這為工程師在建構 AI 路由與整合系統時提供了明確的架構指導。
- 論文地址:ArXiv 論文連結
其他分享
Code Arena WebDev 程式碼能力最新榜單:GPT-6 Astra Max 拔得頭籌
- 內容簡介:根據 Code Arena 最新公佈的 WebDev 評測榜單,OpenAI 的 GPT-6 Astra (Max) 以 1,800 分高居榜首,Anthropic 的 Claude Fable 5.1 (Max) 則以 1,758 分緊隨其後。細分領域顯示,Astra 在資料分析與消費性平臺應用上佔優,而 Fable 在模擬與基於參考設計的網頁開發上表現突出。值得注意的是,儘管 Astra 總分領先,但在開發者頭對頭的匿名對決中,Fable 5.1 仍贏得了極高的青睞度。
- 傳送門:
In the Code Arena: WebDev, @OpenAI's GPT-6 Astra (Max) is ranked #1 (1800 pts), and Claude Fable 5.1 (Max) is ranked #2 (1758 pts). Here is a look at win rates for these models.
— Arena.ai (@arena) September 16, 2026
Win rate measures how often people prefer one model’s response in Arena’s anonymous head-to-head… pic.twitter.com/a0q969IYxf

