news

AI日報|Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API

September 11, 2026
Updated Sep 11
5 min read
openai
幅壓縮快取、OpenAI 推出 Ag
anthropic
服務,以及 Anthropic 發布的最新
kimi
的開源基座 Kimi K3 進行
devin
-2 已在 Devin Deskt
fireworks
RL at Fireworks: http
deepseek
SWE-2、DeepSeek-V4.1-
news
AI日報|Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API
2026-09-11

AI日報|Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API

本期科技日報整理了近期的 AI 模型更新與業界動態,包含軟體工程模型、推論架構調整、多代理雲端服務,以及 Anthropic 發布的最新安全評估報告。


1. Cognition 發布 SWE-2 軟體工程模型

Cognition 官方技術報告 公開了新一代軟體工程模型 SWE-2。模型基於 2.8 兆參數的開源基座 Kimi K3 進行強化學習後訓練。

官方評測指出,SWE-2 在 FrontierCode 1.1 Main 測試中取得 50.0% 的成績,與目前領先的 Fable 5.1(50.9%)相近,但推論花費降低了約 64%。Cognition 在訓練中加入線形成本懲罰函數($R = S - \lambda_e C$),試圖在任務成功率與運算成本之間尋找更好的平衡。

針對前代模型容易過度探索程式庫的問題,官方數據顯示 SWE-2 Medium 首次修改代碼的中位數步數從 48 步降至 18 步,調用輪次減少 58%。目前 SWE-2 已在 Devin Desktop 與 CLI 上線。


2. DeepSeek 開源 DeepSeek-V4.1-Flash:重構 KV 快取機制

DeepSeek 透過 Hugging Face 專案頁面 釋出 552B 參數的多模態混合專家模型 DeepSeek-V4.1-Flash,支援百萬上下文視窗,並採用 MIT 授權。

這次更新主要針對長文本推論的記憶體消耗進行了架構調整。模型改用因果編解碼結構(CED),解碼器的全域 KV 快取直接由編碼器最後一層的隱藏狀態投影產生。官方指出,這讓模型在 Prefill 階段僅需啟用 8B 參數,Decode 階段啟用 16B 參數。

結合壓縮稀疏注意力二代(CSA2)技術,官方測試將全域 KV 快取壓縮至每 Token 890 位元組。在效能表現上,模型在 Terminal-Bench 2.1 取得 90.6 分,DeepSWE v1.1 達到 74.2% 解決率。


3. OpenAI 於 API 推出 GPT-Live-1 語音模型

OpenAI 宣布 將 ChatGPT 的全雙工語音能力開放至 API。有別於傳統串接語音辨識、文字模型與語音合成的架構,GPT-Live-1 採用單一神經網絡處理音訊輸出入。

根據參與測試的語音學習平台 Speak 回報,單一模型的設計降低了打斷處理的延遲,誤判使用者插話的頻率約下降 80%。此外,模型支援「推論委派」機制,在對話過程中,可以將需要複雜邏輯的任務轉交給後端的 GPT-6 Astra 或 5.6 Terra 處理。

前端語音層定價為每分鐘 0.05 美元。OpenAI 提供的 Full Duplex Bench 測試結果顯示,該模型效能較前代 GPT-Realtime-2.1 提升了 30%。


4. OpenAI 發表 Agents API 公開測試版

針對開發自主代理常遇到的上下文管理問題,OpenAI 公開 Agents API 測試版。該服務開放了支撐 Codex 的底層架構,允許開發者透過 API 設定任務、工具與運算沙盒。

API 內建了自動壓縮機制,當會話接近 Token 上限時會自動提煉對話內容。同時支援多代理協同(Multi-agent),主代理可將任務分配給多個具備獨立上下文的子代理並行處理。

參與早期導入的技術團隊 Ciridae 表示,改用該 API 的子代理協同方案後,系統整體延遲降至原先的四分之一。該服務依模型 Token 與工具使用量計費,免收額外架構管理費。


5. Cursor 推出 Projects 測試版:支援專案級別代理調度

Cursor 發布 Projects 功能測試版,將編輯視角擴大至專案層級。使用者可透過單一協調者(Coordinator)管理多個在雲端運行的子代理,執行後台編譯、靜態分析與代碼重構。

這套系統會維護一組動態同步檔案,讓所有代理共享程式庫架構與測試規範。若一個代理找到某項微服務的測試路徑,其他代理可直接沿用。

Cursor 內部數據指出,啟用該功能後,新使用者合併 PR 的數量平均增加了 30%,而重度使用者的 PR 合併量則有更顯著的成長。目前 Cursor 團隊已利用此工具完成內部的樣式系統遷移。


6. CursorBench 4.0 評測基準上線

隨著 AI 輔助開發工具的能力提升,CursorBench 發布 4.0 版本,將測試重點轉向多檔案編輯、全面重構與除錯溯源等長週期任務。

在最新榜單中,Claude Fable 5.1 Max 取得 51.8% 的最高分,平均每任務成本為 17.28 美元;Claude Opus 5 Max 以 46.6% 緊追其後。

部分中輕量模型在成本效益上表現突出,例如 Muse Spark 1.3 Max 以每任務 2.64 美元的花費取得 41.6% 的成績;GPT-5.6 Sol Max 則以 8.23 美元的成本取得 41.7%。


7. 算力吃緊:OpenAI 暫停 200 美元 Pro 方案新增註冊

OpenAI 產品主管 Tibo 在 社群平台表示,由於 GPT-6 Astra 模型的使用需求大幅超出預期,即日起暫停每月 200 美元 Pro 方案的新用戶註冊。

官方說明,Pro 方案用戶在自動化工作流程中大量調用了最高強度的推論,給雲端叢集帶來不小壓力。暫停註冊是為了維持現有付費用戶的連線穩定。既有訂閱者、一般方案與 API 開發者皆不受影響。OpenAI 表示目前正在擴充運算節點。


8. Anthropic 發布安全測試報告:評估 AI 戰術情報與定位能力

Anthropic 前沿紅隊發表最新研究,評估語言與多模態模型在戰術情報定位與常規武器研發上的邊界。

在數位足跡比對測試中,Claude Mythos Preview 花費約 11 分鐘解析了一份 3.7 萬字的情報樣本,官方對照組的人類情報分析員則需約 2.5 小時。在無標籤影像的地理定位測試中,Mythos 5 的中位數距離誤差為 47.2 公里,而 GeoGuessr 人類冠軍分區的中位數誤差約為 151 公里。

在無人機控制軟體編寫測試中,Claude Opus 5 展示了撰寫卡爾曼濾波器與比例導引算法的能力。針對這些發現,Anthropic 已更新內部分類器,攔截與自主制導或武器設計相關的異常請求。

  • 新聞連結

9. OpenAI 發表 ChatGPT 金融服務版

OpenAI 推出 ChatGPT for Financial Services,專為投資銀行與資產管理機構設計。

該版本直接在雲端預先託管了 Daloopa、PitchBook 等財經數據庫,並支援串接客戶既有的 S&P Capital IQ 或 MSCI 權限。分析師可以點擊數據直接回溯至財報原文。

官方表示,搭載財務邏輯調優版 GPT-6 Astra 的系統在 OfficeQA Pro 評測中取得 69.9% 的分數,高於一般版本的 60.2%。客戶數據依據 SCIM 規範管理,預設不作為模型訓練使用。


10. OpenAI 推出 Data Agent:自然語言資料分析工具

OpenAI 發布企業級數據代理 Data Agent,讓使用者透過自然語言提問來查詢資料並生成互動式儀表板,減少手寫 SQL 的需求。

Data Agent 支援對接 Google BigQuery、Databricks、Snowflake 等資料庫,並能解析企業內部的語義層(如 dbt 模型)以確保 KPI 計算邏輯一致。生成的圖表可直接匯出至 Tableau 或 Power BI 等商業智慧工具中。


11. Genspark 發表專用簡報模型 Gen-1 Slides

Genspark 團隊公開了 Gen-1 Slides 的模型細節。為解決通用大模型在排版與視覺層次上的失誤,他們以 MiniMax M3 為基座,訓練出專門生成商務簡報的模型。

官方表示,訓練過程採用廣義序列策略優化(GSPO),並引入對抗判別器減少「AI 排版痕跡」。在內部測試中,Gen-1 Slides 得分為 0.821(Claude Opus 5 為 0.810)。重點在於推論成本,實測生成整份投影片的花費為 0.44 美元,約為 Opus 5 的九分之一。

  • 傳送門

12. Cohere 開源機器翻譯模型 North Small Translate

Cohere 釋出 North Small Translate 模型。該模型採用混合專家(MoE)架構,總參數 218B,推論啟用 25B 參數,以 CC BY-NC 4.0 授權開放。

在 WMT26 多語言評測中,該模型取得 83.60 分(對照組 Qwen 3.5 為 81.56,DeepL NextGen 為 81.37)。硬體需求方面,單張 B200 或兩張 H100 即可運行量化版本。


13. Google Cloud 推出 AI 代理開發外掛

Google Cloud 發布 google-cloud-developer 外掛,協助代碼代理操作基礎架構。

該外掛整合了 MCP 伺服器,支援 Claude Code 與 Codex CLI 等工具。工程師指派代理建立專案時,外掛會進行權限檢查,並在執行 gcloud CLI 指令前列出操作清單要求人類確認,以降低資安風險。


14. Gemini 桌面版應用程式登陸 Windows

Google 宣布 Windows 版 Gemini 桌面應用開放下載。支援 Windows 10 與 11 系統,使用者可透過 Alt + Space 快捷鍵喚起介面,不需切換至瀏覽器。

軟體內建 Nano Banana 圖像生成與 Gemini Omni 視訊套件,並支援與 Google 雲端硬碟及 Gmail 整合以處理辦公任務。


15. 環球音樂與 ElevenLabs 簽訂授權協議

環球音樂集團(UMG)與語音技術公司 ElevenLabs 宣布達成戰略合作協議

雙方將開發一個音樂協同創作平台。在取得原創者授權後,使用者可透過平台對歌曲進行重新混音或生成人聲衍生作品。平台包含版稅分潤機制,以確保參與計畫的音樂人能從生成內容中獲得合理收益。


16. Google Labs 故事生成應用 Dreambeans 於美國開放

Google Labs 宣布 個人化故事應用 Dreambeans 結束測試,在美國開放滿 18 歲用戶下載。

該應用可連結 Google 行事曆、Gmail、YouTube 及 Google 相簿資料,每日將使用者的近期行程與照片整理成動態的數位故事集。


17. Shopify 宣佈全面棄用 React Native,重回 Swift / Kotlin 原生開發

Shopify 工程團隊發布文章,宣佈將旗下所有行動應用程式從使用 6 年的 React Native 全面遷移回 Swift 與 Kotlin 原生程式碼庫。

官方說明指出,過往採用跨平台框架旨在避免同一功能重複開發,但如今 AI Coding Agent 已能承擔絕大部分跨平台轉譯、測試與實作工作,讓原生開發帶來的效能與體驗優勢徹底壓過跨平台維護成本。這標誌著 AI 程式碼生成能力正在根本性地重塑軟體工程架構決策。


18. 騰訊開源語音基礎模型 AuK 與極速版 AuK-Flash

騰訊混元團隊專案主頁 上線並開源了基礎語音模型 AuK(也被稱為「音訊版 Nano Banana」)。

AuK 採用 Apache-2.0 授權,整合了 Zero-shot TTS、口音去除、音色/情緒/風格編輯、語速音調控制及人聲伴奏分離等全功能統一介面。同步推出的 AuK-Flash 4 步快速推論版本,能在維持優異音質的前提下提升約 4.5 倍的推論速度。


19. Suno 發布 v6 多模態 AI 音樂生成模型

Suno 官方宣布 推出新一代 AI 音樂生成模型 Suno v6。

該模型支援從文字、圖片、影片及語音備忘錄等多模態內容直接創作音樂,使用者可上傳短片、照片或隨手哼唱的語音進行生成。系統同時支援自然語言細粒度編輯與重新混音,並推出 v6、高創意的 v6-wild 與快速輕量的 v6-mini 三種版本。


20. OpenRouter 上線有狀態 Shell 工具 openrouter:shell

OpenRouter 上線了全新有狀態伺服器端工具 openrouter:shell

現在平台上的任何大語言模型皆能直接在託管的 Linux 容器中執行 Shell 指令,並透過 Files API 傳輸檔案,計費僅為每活躍秒 0.0001 美元,大幅降低了 Agent 自動化測試與執行腳本的門檻。

  • 體驗通道

21. Google Research 發表 ToolGrad 論文:以文字梯度高效生成工具呼叫資料集

Google Research 發布研究論文,提出 ToolGrad 框架(發表於 ACL 2026)。

研究顛覆了傳統 LLM 直接生成「查詢-軌跡」的昂貴做法,改為先由 LLM 自動構建可執行的工具呼叫鏈,再利用「文字梯度(Textual Gradients)」反向標註並最佳化出對應的使用者原始查詢,大幅降低了高品質 Agent Tool-use 訓練資料集的生成成本與幻覺率。


22. Cognition 展示多 Devin AI Agent 成功完成大數 RSA-260 因式分解

Cognition 官方部落格 發表最新技術實驗,驅動多個 Devin AI Agent 自主規劃並編寫了高效能 GPU 格子篩(Lattice Sieve)分散式管線,成功完成了 260 位大數 RSA-260 的質因數分解。

此舉刷新了自 2020 年 RSA-250 以來保持至今的公開 RSA 挑戰紀錄,證明 AI Agent 已具備承擔頂尖數學與密碼工程研究的能力。


23. 開源框架 Edge0 支援 iPhone 本地端運行 35B 大模型

開源專案 Edge0 正式發布,提供了專為行動裝置與本地硬體最佳化的模型執行時(Runtime)。

該框架能讓 35B 參數量的 LLM 在 iPhone 上完全本地端離線執行,峰值記憶體僅需 1–2.5 GB,並支援在裝置端直接進行 3D 場景渲染與網頁生成。

  • 傳送門

問與答(Q&A)

Q1:Cognition SWE-2 在效能與成本上的數據為何?

A1:根據官方文件,SWE-2 在 FrontierCode 1.1 評測中取得 50.0% 的成績,運行成本較前代降低了 64%。在首次修改代碼的平均步數上,SWE-2 Medium 降至 18 步,減少了模型無效探索的輪次。

Q2:DeepSeek-V4.1-Flash 如何壓縮 KV 快取?

A2:該模型採用 40 層的因果編解碼架構(CED),讓解碼器直接從編碼器取得投影,省去逐層保存的空間。搭配壓縮稀疏注意力二代(CSA2),官方測試顯示其全域 KV 快取可壓縮至每 Token 890 位元組。

Q3:為何 OpenAI 暫停 200 美元 Pro 方案註冊?

A3:產品主管表示,因新模型 GPT-6 Astra 的高強度推論需求超乎預期,雲端算力出現瓶頸。為確保現有付費用戶的連線穩定性,在節點擴充完成前暫停新戶註冊。現有用戶與 API 開發者不受影響。

Q4:Anthropic 對 AI 戰術定位能力的測試有何發現?

A4:在 Anthropic 的安全測試中,Claude Mythos Preview 能在 11 分鐘內解析 3.7 萬字的情報文本(人類對照組約需 2.5 小時)。在純視覺地理定位測試上,Mythos 5 的誤差中位數為 47.2 公里,優於 GeoGuessr 人類選手的平均水準。

Q5:Genspark Gen-1 Slides 的優勢為何?

A5:Genspark 捨棄通用大模型,改以 MiniMax M3 針對商務簡報進行微調。官方指出,其排版與視覺品質在內部評測中略優於 Claude Opus 5,但生成一份投影片的成本降至 0.44 美元(Opus 5 為 4.16 美元),主要解決了商務生成的成本問題。

Q6:Shopify 為何決定棄用 React Native 重回 Swift/Kotlin 原生開發?

A6:Shopify 表示過去使用跨平台框架是為了節省重複開發的人力成本,但現在 AI Coding Agent 已能高效處理跨平台代碼轉譯與編寫,使原生開發在效能與使用者體驗上的優勢重新凌駕於維護成本之上。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.