AI日報|Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API
本期科技日報整理了近期的 AI 模型更新與業界動態,包含軟體工程模型、推論架構調整、多代理雲端服務,以及 Anthropic 發布的最新安全評估報告。
1. Cognition 發布 SWE-2 軟體工程模型
Cognition 官方技術報告 公開了新一代軟體工程模型 SWE-2。模型基於 2.8 兆參數的開源基座 Kimi K3 進行強化學習後訓練。
官方評測指出,SWE-2 在 FrontierCode 1.1 Main 測試中取得 50.0% 的成績,與目前領先的 Fable 5.1(50.9%)相近,但推論花費降低了約 64%。Cognition 在訓練中加入線形成本懲罰函數($R = S - \lambda_e C$),試圖在任務成功率與運算成本之間尋找更好的平衡。
針對前代模型容易過度探索程式庫的問題,官方數據顯示 SWE-2 Medium 首次修改代碼的中位數步數從 48 步降至 18 步,調用輪次減少 58%。目前 SWE-2 已在 Devin Desktop 與 CLI 上線。
- 傳送門:
Reinforcement learning at @cognition's scale is a hard infrastructure problem. We are proud to be part of the stack behind it.
— Fireworks (@FireworksAI_HQ) September 10, 2026
Congrats to the team on SWE-2!
Read more about how we think about RL at Fireworks: https://t.co/b5w5LXtGCl https://t.co/xafXX2y2aQ
2. DeepSeek 開源 DeepSeek-V4.1-Flash:重構 KV 快取機制
DeepSeek 透過 Hugging Face 專案頁面 釋出 552B 參數的多模態混合專家模型 DeepSeek-V4.1-Flash,支援百萬上下文視窗,並採用 MIT 授權。
這次更新主要針對長文本推論的記憶體消耗進行了架構調整。模型改用因果編解碼結構(CED),解碼器的全域 KV 快取直接由編碼器最後一層的隱藏狀態投影產生。官方指出,這讓模型在 Prefill 階段僅需啟用 8B 參數,Decode 階段啟用 16B 參數。
結合壓縮稀疏注意力二代(CSA2)技術,官方測試將全域 KV 快取壓縮至每 Token 890 位元組。在效能表現上,模型在 Terminal-Bench 2.1 取得 90.6 分,DeepSWE v1.1 達到 74.2% 解決率。
3. OpenAI 於 API 推出 GPT-Live-1 語音模型
OpenAI 宣布 將 ChatGPT 的全雙工語音能力開放至 API。有別於傳統串接語音辨識、文字模型與語音合成的架構,GPT-Live-1 採用單一神經網絡處理音訊輸出入。
根據參與測試的語音學習平台 Speak 回報,單一模型的設計降低了打斷處理的延遲,誤判使用者插話的頻率約下降 80%。此外,模型支援「推論委派」機制,在對話過程中,可以將需要複雜邏輯的任務轉交給後端的 GPT-6 Astra 或 5.6 Terra 處理。
前端語音層定價為每分鐘 0.05 美元。OpenAI 提供的 Full Duplex Bench 測試結果顯示,該模型效能較前代 GPT-Realtime-2.1 提升了 30%。
4. OpenAI 發表 Agents API 公開測試版
針對開發自主代理常遇到的上下文管理問題,OpenAI 公開 Agents API 測試版。該服務開放了支撐 Codex 的底層架構,允許開發者透過 API 設定任務、工具與運算沙盒。
API 內建了自動壓縮機制,當會話接近 Token 上限時會自動提煉對話內容。同時支援多代理協同(Multi-agent),主代理可將任務分配給多個具備獨立上下文的子代理並行處理。
參與早期導入的技術團隊 Ciridae 表示,改用該 API 的子代理協同方案後,系統整體延遲降至原先的四分之一。該服務依模型 Token 與工具使用量計費,免收額外架構管理費。
5. Cursor 推出 Projects 測試版:支援專案級別代理調度
Cursor 發布 Projects 功能測試版,將編輯視角擴大至專案層級。使用者可透過單一協調者(Coordinator)管理多個在雲端運行的子代理,執行後台編譯、靜態分析與代碼重構。
這套系統會維護一組動態同步檔案,讓所有代理共享程式庫架構與測試規範。若一個代理找到某項微服務的測試路徑,其他代理可直接沿用。
Cursor 內部數據指出,啟用該功能後,新使用者合併 PR 的數量平均增加了 30%,而重度使用者的 PR 合併量則有更顯著的成長。目前 Cursor 團隊已利用此工具完成內部的樣式系統遷移。
6. CursorBench 4.0 評測基準上線
隨著 AI 輔助開發工具的能力提升,CursorBench 發布 4.0 版本,將測試重點轉向多檔案編輯、全面重構與除錯溯源等長週期任務。
在最新榜單中,Claude Fable 5.1 Max 取得 51.8% 的最高分,平均每任務成本為 17.28 美元;Claude Opus 5 Max 以 46.6% 緊追其後。
部分中輕量模型在成本效益上表現突出,例如 Muse Spark 1.3 Max 以每任務 2.64 美元的花費取得 41.6% 的成績;GPT-5.6 Sol Max 則以 8.23 美元的成本取得 41.7%。
7. 算力吃緊:OpenAI 暫停 200 美元 Pro 方案新增註冊
OpenAI 產品主管 Tibo 在 社群平台表示,由於 GPT-6 Astra 模型的使用需求大幅超出預期,即日起暫停每月 200 美元 Pro 方案的新用戶註冊。
官方說明,Pro 方案用戶在自動化工作流程中大量調用了最高強度的推論,給雲端叢集帶來不小壓力。暫停註冊是為了維持現有付費用戶的連線穩定。既有訂閱者、一般方案與 API 開發者皆不受影響。OpenAI 表示目前正在擴充運算節點。
8. Anthropic 發布安全測試報告:評估 AI 戰術情報與定位能力
Anthropic 前沿紅隊發表最新研究,評估語言與多模態模型在戰術情報定位與常規武器研發上的邊界。
在數位足跡比對測試中,Claude Mythos Preview 花費約 11 分鐘解析了一份 3.7 萬字的情報樣本,官方對照組的人類情報分析員則需約 2.5 小時。在無標籤影像的地理定位測試中,Mythos 5 的中位數距離誤差為 47.2 公里,而 GeoGuessr 人類冠軍分區的中位數誤差約為 151 公里。
在無人機控制軟體編寫測試中,Claude Opus 5 展示了撰寫卡爾曼濾波器與比例導引算法的能力。針對這些發現,Anthropic 已更新內部分類器,攔截與自主制導或武器設計相關的異常請求。
- 新聞連結:
We're publishing our most detailed threat intelligence report to date.
— Anthropic (@AnthropicAI) September 10, 2026
It covers how people tried to misuse Claude—for cyberattacks, influence operations, surveillance, biology, and building weapons—and how we found and stopped them.
We disrupted every operation in the report,…
9. OpenAI 發表 ChatGPT 金融服務版
OpenAI 推出 ChatGPT for Financial Services,專為投資銀行與資產管理機構設計。
該版本直接在雲端預先託管了 Daloopa、PitchBook 等財經數據庫,並支援串接客戶既有的 S&P Capital IQ 或 MSCI 權限。分析師可以點擊數據直接回溯至財報原文。
官方表示,搭載財務邏輯調優版 GPT-6 Astra 的系統在 OfficeQA Pro 評測中取得 69.9% 的分數,高於一般版本的 60.2%。客戶數據依據 SCIM 規範管理,預設不作為模型訓練使用。
10. OpenAI 推出 Data Agent:自然語言資料分析工具
OpenAI 發布企業級數據代理 Data Agent,讓使用者透過自然語言提問來查詢資料並生成互動式儀表板,減少手寫 SQL 的需求。
Data Agent 支援對接 Google BigQuery、Databricks、Snowflake 等資料庫,並能解析企業內部的語義層(如 dbt 模型)以確保 KPI 計算邏輯一致。生成的圖表可直接匯出至 Tableau 或 Power BI 等商業智慧工具中。
11. Genspark 發表專用簡報模型 Gen-1 Slides
Genspark 團隊公開了 Gen-1 Slides 的模型細節。為解決通用大模型在排版與視覺層次上的失誤,他們以 MiniMax M3 為基座,訓練出專門生成商務簡報的模型。
官方表示,訓練過程採用廣義序列策略優化(GSPO),並引入對抗判別器減少「AI 排版痕跡」。在內部測試中,Gen-1 Slides 得分為 0.821(Claude Opus 5 為 0.810)。重點在於推論成本,實測生成整份投影片的花費為 0.44 美元,約為 Opus 5 的九分之一。
- 傳送門:
Meet Gen-1 Slides, Genspark’s first model designed for knowledge work.
— Genspark (@genspark_ai) September 10, 2026
Trained with @FireworksAI_HQ from an open-weight base, Gen-1 Slides now powers Standard mode in Genspark AI Slides, delivering frontier quality decks at roughly 1/17th of Opus 5’s price.
Fewer midnight… pic.twitter.com/D4DMoVHN9q
12. Cohere 開源機器翻譯模型 North Small Translate
Cohere 釋出 North Small Translate 模型。該模型採用混合專家(MoE)架構,總參數 218B,推論啟用 25B 參數,以 CC BY-NC 4.0 授權開放。
在 WMT26 多語言評測中,該模型取得 83.60 分(對照組 Qwen 3.5 為 81.56,DeepL NextGen 為 81.37)。硬體需求方面,單張 B200 或兩張 H100 即可運行量化版本。
13. Google Cloud 推出 AI 代理開發外掛
Google Cloud 發布 google-cloud-developer 外掛,協助代碼代理操作基礎架構。
該外掛整合了 MCP 伺服器,支援 Claude Code 與 Codex CLI 等工具。工程師指派代理建立專案時,外掛會進行權限檢查,並在執行 gcloud CLI 指令前列出操作清單要求人類確認,以降低資安風險。
14. Gemini 桌面版應用程式登陸 Windows
Google 宣布 Windows 版 Gemini 桌面應用開放下載。支援 Windows 10 與 11 系統,使用者可透過 Alt + Space 快捷鍵喚起介面,不需切換至瀏覽器。
軟體內建 Nano Banana 圖像生成與 Gemini Omni 視訊套件,並支援與 Google 雲端硬碟及 Gmail 整合以處理辦公任務。
15. 環球音樂與 ElevenLabs 簽訂授權協議
環球音樂集團(UMG)與語音技術公司 ElevenLabs 宣布達成戰略合作協議。
雙方將開發一個音樂協同創作平台。在取得原創者授權後,使用者可透過平台對歌曲進行重新混音或生成人聲衍生作品。平台包含版稅分潤機制,以確保參與計畫的音樂人能從生成內容中獲得合理收益。
16. Google Labs 故事生成應用 Dreambeans 於美國開放
Google Labs 宣布 個人化故事應用 Dreambeans 結束測試,在美國開放滿 18 歲用戶下載。
該應用可連結 Google 行事曆、Gmail、YouTube 及 Google 相簿資料,每日將使用者的近期行程與照片整理成動態的數位故事集。
17. Shopify 宣佈全面棄用 React Native,重回 Swift / Kotlin 原生開發
Shopify 工程團隊發布文章,宣佈將旗下所有行動應用程式從使用 6 年的 React Native 全面遷移回 Swift 與 Kotlin 原生程式碼庫。
官方說明指出,過往採用跨平台框架旨在避免同一功能重複開發,但如今 AI Coding Agent 已能承擔絕大部分跨平台轉譯、測試與實作工作,讓原生開發帶來的效能與體驗優勢徹底壓過跨平台維護成本。這標誌著 AI 程式碼生成能力正在根本性地重塑軟體工程架構決策。
18. 騰訊開源語音基礎模型 AuK 與極速版 AuK-Flash
騰訊混元團隊專案主頁 上線並開源了基礎語音模型 AuK(也被稱為「音訊版 Nano Banana」)。
AuK 採用 Apache-2.0 授權,整合了 Zero-shot TTS、口音去除、音色/情緒/風格編輯、語速音調控制及人聲伴奏分離等全功能統一介面。同步推出的 AuK-Flash 4 步快速推論版本,能在維持優異音質的前提下提升約 4.5 倍的推論速度。
19. Suno 發布 v6 多模態 AI 音樂生成模型
Suno 官方宣布 推出新一代 AI 音樂生成模型 Suno v6。
該模型支援從文字、圖片、影片及語音備忘錄等多模態內容直接創作音樂,使用者可上傳短片、照片或隨手哼唱的語音進行生成。系統同時支援自然語言細粒度編輯與重新混音,並推出 v6、高創意的 v6-wild 與快速輕量的 v6-mini 三種版本。
20. OpenRouter 上線有狀態 Shell 工具 openrouter:shell
OpenRouter 上線了全新有狀態伺服器端工具 openrouter:shell。
現在平台上的任何大語言模型皆能直接在託管的 Linux 容器中執行 Shell 指令,並透過 Files API 傳輸檔案,計費僅為每活躍秒 0.0001 美元,大幅降低了 Agent 自動化測試與執行腳本的門檻。
- 體驗通道:
New stateful server tool: Shell!
— OpenRouter (@OpenRouter) September 10, 2026
Any model on OpenRouter can now run commands in a hosted Linux container and use the new Files API to move files in and out. Available today in beta: `openrouter:shell` pic.twitter.com/EnvCW87w2v
21. Google Research 發表 ToolGrad 論文:以文字梯度高效生成工具呼叫資料集
Google Research 發布研究論文,提出 ToolGrad 框架(發表於 ACL 2026)。
研究顛覆了傳統 LLM 直接生成「查詢-軌跡」的昂貴做法,改為先由 LLM 自動構建可執行的工具呼叫鏈,再利用「文字梯度(Textual Gradients)」反向標註並最佳化出對應的使用者原始查詢,大幅降低了高品質 Agent Tool-use 訓練資料集的生成成本與幻覺率。
22. Cognition 展示多 Devin AI Agent 成功完成大數 RSA-260 因式分解
Cognition 官方部落格 發表最新技術實驗,驅動多個 Devin AI Agent 自主規劃並編寫了高效能 GPU 格子篩(Lattice Sieve)分散式管線,成功完成了 260 位大數 RSA-260 的質因數分解。
此舉刷新了自 2020 年 RSA-250 以來保持至今的公開 RSA 挑戰紀錄,證明 AI Agent 已具備承擔頂尖數學與密碼工程研究的能力。
23. 開源框架 Edge0 支援 iPhone 本地端運行 35B 大模型
開源專案 Edge0 正式發布,提供了專為行動裝置與本地硬體最佳化的模型執行時(Runtime)。
該框架能讓 35B 參數量的 LLM 在 iPhone 上完全本地端離線執行,峰值記憶體僅需 1–2.5 GB,並支援在裝置端直接進行 3D 場景渲染與網頁生成。
- 傳送門:
恭喜晓东,Edge0终于正式开源了👏
— AI Will (@FinanceYF5) September 10, 2026
这次他们把8B、35B模型,连同运行时和推理代码都放了出来。35B模型可以在手机和电脑上本地运行,峰值内存只有1–2.5GB,游戏、3D场景和网页也能完全在设备端生成。
做端侧AI的朋友可以去试试,也欢迎给他们提提意见。 https://t.co/wrHhe7W7KT
問與答(Q&A)
Q1:Cognition SWE-2 在效能與成本上的數據為何?
A1:根據官方文件,SWE-2 在 FrontierCode 1.1 評測中取得 50.0% 的成績,運行成本較前代降低了 64%。在首次修改代碼的平均步數上,SWE-2 Medium 降至 18 步,減少了模型無效探索的輪次。
Q2:DeepSeek-V4.1-Flash 如何壓縮 KV 快取?
A2:該模型採用 40 層的因果編解碼架構(CED),讓解碼器直接從編碼器取得投影,省去逐層保存的空間。搭配壓縮稀疏注意力二代(CSA2),官方測試顯示其全域 KV 快取可壓縮至每 Token 890 位元組。
Q3:為何 OpenAI 暫停 200 美元 Pro 方案註冊?
A3:產品主管表示,因新模型 GPT-6 Astra 的高強度推論需求超乎預期,雲端算力出現瓶頸。為確保現有付費用戶的連線穩定性,在節點擴充完成前暫停新戶註冊。現有用戶與 API 開發者不受影響。
Q4:Anthropic 對 AI 戰術定位能力的測試有何發現?
A4:在 Anthropic 的安全測試中,Claude Mythos Preview 能在 11 分鐘內解析 3.7 萬字的情報文本(人類對照組約需 2.5 小時)。在純視覺地理定位測試上,Mythos 5 的誤差中位數為 47.2 公里,優於 GeoGuessr 人類選手的平均水準。
Q5:Genspark Gen-1 Slides 的優勢為何?
A5:Genspark 捨棄通用大模型,改以 MiniMax M3 針對商務簡報進行微調。官方指出,其排版與視覺品質在內部評測中略優於 Claude Opus 5,但生成一份投影片的成本降至 0.44 美元(Opus 5 為 4.16 美元),主要解決了商務生成的成本問題。
Q6:Shopify 為何決定棄用 React Native 重回 Swift/Kotlin 原生開發?
A6:Shopify 表示過去使用跨平台框架是為了節省重複開發的人力成本,但現在 AI Coding Agent 已能高效處理跨平台代碼轉譯與編寫,使原生開發在效能與使用者體驗上的優勢重新凌駕於維護成本之上。



