AI日報|OpenAI 發表數學難題證明、DeepMind 基因地圖與 Cohere 推論引擎
今天的 AI 科技進展涵蓋數學證明、基因預測、影像生成與底層運算架構。以下是六項值得關注的技術更新。
OpenAI 內部模型提出 Navier-Stokes 奇異點證明
OpenAI 近期展示了一項數學研究成果,利用內部模型(官方表示運算量高於 GPT-6 Astra)探討流體動力學中的 Navier-Stokes 問題。官方指出,研究團隊部署了約 10,000 個具備網路檢索與程式碼執行能力的並發 AI 代理。在 88 小時的運作中,系統消耗約 1,300 億個 token,最終產出了一份分析證明,並透過 Lean 語言完成形式化驗證。
該證明確認了在特定條件下,不可壓縮流體可在有限時間內發展出速度無限增長的「奇異點」。幾乎在同一時間,紐約大學與 Anthropic 的研究人員也獨立解決了相關的「受迫歐拉問題」(forced Euler problem)。這顯示 AI 已能協助人類研究員探索部分高難度的數學分析問題。
Google DeepMind 發佈 AlphaGenome Atlas 基因變異資料庫
DeepMind 推出 AlphaGenome Atlas,將人類基因組中約 90 億種單一鹼基變異的預測影響彙整為 1 PB 的資料庫。過去科學家的研究多集中於占整體 2% 的編碼區,而這個資料庫則補足了剩餘 98% 非編碼區的預測數據。
系統透過「AlphaGenome 變異影響評分」(AVI) 來量化變異影響。根據 DeepMind 提供的應用案例,Broad 研究所利用這套評分系統,在數千個候選變異中定位出導致罕見癲癇性腦病的 DNM1 基因變異;另有研究團隊利用此工具在英國生物樣本庫 (UK Biobank) 中,標記了 19 個與 BMI 相關的基因區域。
ChatGPT Images 2.5 降低延遲,新增草圖生成功能
OpenAI 釋出 ChatGPT Images 2.5。官方測試顯示,新版模型的影像生成延遲較前代降低約 50%。在局部編輯上,模型能在多輪對話中維持原始影像的主態與構圖,僅修改使用者指定的區域。
新加入的 Sketch 功能允許使用者直接在介面中繪製草圖(如房間佈局或服裝輪廓),模型會以此為基礎生成影像。針對開發者,API 則同步提供主打生成速度的 Flare 模型,以及強調高解析度控制的 Sunburst 模型。
Meta 推出具備本機與網頁權限的 Muse 代理助理
Meta 發表了名為 Muse 的 AI 代理助理。與一般對話模型不同,Muse 擁有獨立的檔案系統、終端機與網頁瀏覽器操作權限,可在背景執行如跨應用排程、資料搜尋等任務。
由於涉及實際操作,Muse 在介面上加入了強制確認機制。當遇到購物結帳或發送郵件等不可逆動作時,系統會暫停並彈出核准卡片 (approval cards) 要求使用者手動確認。執行過程的日誌則透過名為 Artifacts 的互動式面板呈現。
Inception Labs 發表擴散語言模型 Mercury 2.5
Inception Labs 推出新一代擴散語言模型 (Diffusion LLM) Mercury 2.5。官方測試指出,該模型在 NVIDIA GPU 上能達到每秒 1,107 個 token 的生成速度,支援 260K 的上下文長度,定價為每百萬輸入 token 0.04 美元。
在實際應用端,語音互動開發商 OpenCall 導入 Mercury 2.5 後,實測其模型回應的中位數延遲降至約 170 毫秒。這項更新主要針對需要極低延遲的語音代理 (Voice Agents) 與多模型協同工作流設計。
Cohere 針對自迴歸解碼開發 Megakernel 伺服器引擎
針對大型語言模型在小批次推論時常遇到的記憶體頻寬瓶頸,Cohere 開發了 Megakernel 伺服器引擎。傳統推論引擎會將前向傳播 (forward pass) 拆分成多個核心 (kernel) 依次執行,容易導致 GPU 產生切換與等待的閒置時間。
Megakernel 的做法是將整個前向傳播融合為單一的持續運行核心 (persistent kernel)。GPU 的每個串流多處理器 (SM) 可獨立從全域記憶體讀取任務,並利用計數器處理依賴關係(例如注意力機制計算完後,直接啟動下游任務)。官方的 H100 測試數據顯示,在運行 30B 參數的 North Mini Code 模型時,Megakernel 的解碼速度約為主流框架 vLLM 的 1.25 至 1.41 倍。
模型發布/更新
ChatGPT Images 2.5 (GPT-Image-2.5 Flare & Sunburst) — OpenAI
- 一言以蔽之:生成延遲降低最多 50%、細節與光影大幅躍升,並登頂 Arena 影象生成與編輯三大評測榜單冠軍。
- 核心亮點:
- 雙模型架構策略:推出速度更快、適合日常靈感探索的 Flare,以及具備極致精確度、專攻高階品牌設計的 Sunburst。
- 點對點區域性精確編輯:大幅強化指令遵循與參考圖特徵保持能力,支援只修改畫面特定物件或文字,並維持主體與多輪修改的一致性。
- 整合手繪互動:對話方塊新增
@Sketch塗鴉畫板功能,草圖可直接轉為精美渲染圖,並提供各類設計模板。
- 技術規格:閉源多模態影像模型 / Arena Text-to-Image、Image Edit、Multi-Image Edit 榜單第 1(Sunburst)與第 2(Flare)
- 傳送門:OpenAI 官方發布公告
Mercury 2.5 — Inception Labs
- 一言以蔽之:目前規模最大、能力最強的離散擴散大語言模型,推論效能較前代提升 40%。
- 核心亮點:
- 突破自回歸架構:採用離散擴散(Discrete Diffusion)機制進行文字生成,顯著改善生成吞吐量與推論延遲。
- 基準測試匹敵前沿:在多項綜合推理與程式碼基準測試中,已可正面對標 GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite 與 Claude Haiku 4.5。
- 技術規格:大型離散擴散語言模型(Diffusion LLM)/ 閉源 API
- 傳送門:Inception Labs 官方部落格
Muse Spark 1.3 (Max) — Meta
- 一言以蔽之:重新定義程式碼 Web 開發的 Pareto 效率前沿,以極低成本提供匹敵頂級模型的程式設計推論力。
- 核心亮點:
- 高價效比 Pareto 突破:在 Code Arena: WebDev 榜單衝上第 8 名(超越 Claude Fable 5 與 GPT-5.6 Sol),每百萬 Token 成本僅 $3.50,比同分段競品便宜 30% 至 70%。
- 支援長程推論模式:提供 Max 與 xHigh 多檔推理運算強度,目前已整合進 Cursor 與 Meta 自研個人助理生態。
- 技術規格:開源/權重開放專用推論模型 / Max & xHigh 推理檔位支援
- 傳送門:
Muse Spark 1.3 from Meta is now available in Cursor! pic.twitter.com/jgT8OtOLfO
— Cursor (@cursor_ai) September 8, 2026
DeepSeek V4.1 Flash (內測版) — DeepSeek
- 一言以蔽之:DeepSeek 首次匯入原生多模態架構,推論速度與視覺理解能力同步升級。
- 核心亮點:
- 原生多模態架構:捨棄傳統外掛視覺編碼器方式,改以原生多模態底層進行端到端訓練,細節辨識更為敏銳。
- 加量不加價:維持與 V4 Flash 相同的超低計費標準,並支援單帳號最高 20 個並發呼叫。
- 技術規格:原生多模態輕量級模型 / 開放社群內測呼叫(
deepseek-v4.1-flash-expires-on-0910) - 傳送門:
据说 DeepSeek 官方微信群通知,DeepSeek V4.1 Flash内测了。
— 向阳乔木 (@vista8) September 8, 2026
新模型换了新的模型架构,原生支持多模态,计费与 V4 Flash 相同,单账号最多 20 并发。
把模型 ID 换成 deepseek-v4.1-flash-expires-on-0910 就能测。
第二个我以为是幻觉,说穿条纹西装,仔细看了下果然有条纹... pic.twitter.com/hBdqTWAN87
產品發布/更新
Muse 全天候主動型個人 AI 助理 — Meta
- 更新內容:Meta 正式推出由 Muse Spark 1.3 驅動的個人 AI 助理「Muse」。Muse 具備原生瀏覽器操控與 24/7 主動運作能力,執行於安全隔離的虛擬機器(VM)環境中,已深度整合 Gmail、Google 日曆、Outlook、1Password 等服務,能主動替使用者處理訂票、比價、購物與跨應用工作流。
- 適用人群:[專業經理人 / 遠距工作者 / 追求高生產力的一般大眾]
- 體驗通道:Muse 官方網站
Runway Plugins for Adobe Premiere Pro & After Effects — Runway
- 更新內容:Runway 推出官方 Adobe 擴充面板,將影片生成、重繪與放大工具直接嵌入 Premiere Pro 與 After Effects 時間線。創作者無需切換應用程式即可在剪輯軌道內呼叫 Aleph 2 模型,並按原始片段時長無縫重新渲染與替換鏡頭。
- 適用人群:[影視剪輯師 / 動效設計師 / 視覺特效後期人員]
- 體驗通道:Runway 官方新聞
Gemini 3.5 Transcribe (macOS) — Google
- 更新內容:Google 為 macOS 版 Gemini 推出專屬語音轉文字模型 Gemini 3.5 Transcribe。能深度結合螢幕即時上下文與語音輸入,支援使用者透過自然語音對本機檔案進行即時摘要、資料研究與跨視窗指令操控。
- 適用人群:[macOS 深度使用者 / 學生 / 辦公族]
- 體驗通道:
Use your voice and screen context to get more done with Gemini 3.5 Transcribe in the Gemini app for macOS.
— Google Gemini (@GeminiApp) September 8, 2026
Gemini 3.5 Transcribe makes it easy to summarize local files, plan and research, and create images using free natural language.
Deep Agents 0.7 (Subagent Forking & Managed Connections) — LangChain
- 更新內容:大幅解決多 Agent 協同架構中的許可權與上下文難題。子 Agent 現可直接「Fork」主管 Agent 的完整對話狀態,避免空白冷啟動;新增的 Managed Connections 機制則將複雜的 OAuth 授權流程抽象化,可一行程式碼宣告 Agent 是以「自身身份」或「使用者身份」代表操作。
- 適用人群:[AI Agent 開發者 / 後端架構師 / 企業自動化工程師]
- 體驗通道:
New in Managed Deep Agents 0.7: Connections https://t.co/3VBFHdJFwW
— LangChain (@LangChain) September 8, 2026
產業動態
OpenAI 萬級 Agent 求解 Navier-Stokes 千禧年難題,引發學術搶發與資料倫理大震盪
- 事件概述:OpenAI 宣佈其未公開的下一代模型(能力顯著超越 GPT-6 Astra)在 10,000 個平行協同 Agent 運作 88 小時(消耗 1,300 億 Token)後,成功構造出三維不可壓縮 Navier-Stokes 方程在有限時間內的奇點解(爆破),並由 GPT-6 Astra 完成 17 小時 Lean 形式化驗證。然而,NYU 數學教授 Tristan Buckmaster 與 Anthropic 研究員 Levent Alpöge 隨即公開指控 OpenAI 是在得知其前期研究傳聞後,投入數百萬美元算力突擊搶發成果並施加署名壓力,引發菲爾茲獎得主陶哲軒(Terence Tao)等學界巨擘公開警告「AI 算力碾壓可能摧毀數百年開放科學研究傳統」。
- 影響分析:標誌著超大規模 AI Agent 叢集已具備攻克百年純數學難題的實質能力,但同時也將科研首創權認定、閉源實驗室利用未公開使用者資料訓練的邊界、以及學術界如何面對「算力霸權」推向風口浪題。
- 新聞連結:OpenAI 官方論文與宣告 與 TechCrunch 深度報導
Mistral AI 完成 30 億歐元 D 輪融資,估值躍升至 210 億歐元
- 事件概述:歐洲開源 AI 領頭羊 Mistral AI 宣佈完成 30 億歐元(約 33 億美元)D 輪融資,投後估值突破 210 億歐元。此輪融資創下歐洲科技公司史上最高單輪股權融資紀錄,資金將全面用於擴充自主持有的訓練與推論算力基礎設施,捍衛開源與主權 AI 競爭力。
- 影響分析:在美中兩強壟斷前沿基礎模型的格局下,歐洲主權 AI(Sovereign AI)與開放權重陣營獲得了龐大資本支撐,有助於維持全球 AI 基礎生態的多元平衡。
- 新聞連結:Mistral AI 官方公告
傳 NVIDIA 擬以 129 億美元收購開源平臺 Hugging Face
- 事件概述:據外媒報導,NVIDIA 正洽談以 129 億美元估值收購全球最大的開源 AI 開發者社群與模型託管平臺 Hugging Face。
- 影響分析:若收購敲定,NVIDIA 將實現從晶片硬體、CUDA 軟體層、雲端推論到全球頂級開源開發者生態的全面垂直整合,進一步加深其在 AI 全產業鏈的護城河。
- 新聞連結:
TechCrunch:Nvidia 即将完成对 Hugging Face 的收购https://t.co/DEKOvt1fVZ
— AI Will (@FinanceYF5) September 8, 2026
Cognition 完成 20 億美元新一輪融資,Devin 估值飆升至 480 億美元
- 事件概述:AI 軟體工程師 Devin 開發商 Cognition 宣佈以 480 億美元估值完成 20 億美元融資,由 a16z、Accel、Founders Fund 等頂級創投領投,距離其上次 260 億美元估值融資僅相隔四個月。
- 影響分析:資本市場對「自主程式設計 AI Agent」顛覆軟體工程研發管線的商業價值給予極高定價,預示著 AI 程式設計賽道的基礎設施與生態整合將迎來更大規模的投入。
- 新聞連結:TechCrunch 報導
論文研究
AlphaGenome Atlas: 人類基因組 90 億單鹼基變異效應預測地圖 — Google DeepMind
- 研究動機:人類基因組包含約 30 億個鹼基對,過去醫學界難以全面評估廣大非編碼區突變對基因調控機制的潛在致病性。
- 核心創新:DeepMind 構建了容量達 1 PB 的開放預測資料庫,結合 AlphaGenome 與 AlphaMissense 模型提出 AVI(AlphaGenome Variant Impact)綜合評分,能精準預測人類基因組全部 90 億種單核苷酸變異(SNV)的分子生物學影響。
- 研究成果:能直接解析基因開關破壞與 RNA 剪接異常等多維度機制,已免費向全球學術界開放 Web 入口、API 及 Antigravity Agent Skill。
- 論文地址:Google DeepMind 官方研究專題
Decode Megakernel for LLM Serving — Cohere
- 研究動機:大語言模型在推論解碼(Decode)階段受限於 GPU 記憶體頻寬與頻繁的 Kernel 啟動開銷,在高並發服務下延遲居高不下。
- 核心創新:Cohere 提出 Decode Megakernel 架構,將 LLM 整個解碼運算步驟融合(Kernel Fusion)進單一 Kernel 呼叫中,大幅提升 GPU 算力利用率並消除中間資料搬移。
- 研究成果:在單張 NVIDIA H100 上部署 North Mini Code 時,單 Batch 推論速度較 vLLM 提升 1.58 倍,多 Batch 端到端推論效能提升達 1.25x–1.41x,成果全面開源。
- 論文地址:Cohere 官方技術部落格
Pretraining Progress Is Mostly Data — Dwarkesh Patel
- 研究動機:探討自 2019 年至 2025 年大型語言模型預訓練能力的巨大提升,究竟有多少比例來自模型架構創新,又有多少來自訓練資料品質的演進。
- 核心創新:在嚴格控制算力預算(最高 1e19 FLOPs)的基準下,交叉評測歷年模型架構配方與各世代資料集語料。
- 研究成果:實測顯示資料改良帶來 12.0 倍的算力效率提升,而架構演進僅帶來 3.7 倍,資料品質對預訓練效能增長的貢獻度高達模型架構的 3.24 倍。
- 論文地址:Dwarkesh Patel 研究專文
其他分享
Deltafin:在 M5 Max MacBook Pro 上以 SSD 串流執行 2.8T Kimi K3
- 內容簡介:開源專案 Deltafin 實現了在 128 GB 記憶體的 M5 Max MacBook Pro 上,透過 4 塊 SSD 進行權重動態串流載入,以 ~1 token/s 的穩定速率本地執行完整的 2.8T 引數 Kimi K3 模型,無須對 MoE 專家權重進行任何剪枝。
- 傳送門:Deltafin GitHub 專案庫
豐田精益生產(Lean)品質管理引入 Claude Code 實踐
- 內容簡介:開發者將經典的「安燈系統(Andon)」與精益品質管制思維移植到 Claude Code 工作流中。每當 Agent 修復錯誤時,自動記錄失敗根因並編譯為反制規範(Lessons/Rules),防止 AI 在後續任務中反覆犯下相同的隱蔽性錯誤。
- 傳送門:Reddit 經驗分享原帖
Whiteboard-Animate:開源白板手繪動畫渲染引擎
- 內容簡介:開源專案
whiteboard-animate可將任意靜態白板圖或架構圖轉換為逼真的逐筆手繪過程 MP4 影片,文字逐字寫出、輪廓順著筆劃描繪,並能自動對齊旁白語音節奏,極適合技術解說與教學影片製作。
問與答(Q&A)
Q1:OpenAI 解決 Navier-Stokes 相關問題的具體方法是什麼? A: 部署了約 10,000 個 AI 代理組成的內部系統,耗時 88 小時與 1,300 億個 token,產出並透過 Lean 語言驗證了奇異點的分析證明。
Q2:AlphaGenome Atlas 提供了什麼新數據? A: 提供了 90 億種單一鹼基突變的預測影響,涵蓋了過去較少被解析的 98% 非編碼區,並利用 AVI 評分協助研究人員排序致病突變。
Q3:Cohere 的 Megakernel 引擎如何在推論時提升效率? A: 將前向傳播融合為單一持續運行的核心,減少 GPU 切換任務的等待時間,官方測試顯示在特定模型推論上比 vLLM 快 1.25 至 1.41 倍。
Q4:Mercury 2.5 模型主打的效能數據為何? A: 官方數據稱在 NVIDIA GPU 上最高可達每秒 1,107 個 token 速度,第三方(OpenCall)實測應用於語音代理時可將回應延遲壓低至 170 毫秒左右。
Q5:Meta Muse 代理如何防止權限過大導致的誤操作? A: 在執行購物或寄信等不可逆操作時,會強制跳出核准卡片 (approval cards) 要求使用者確認,不會自動執行。



