news

AI日報|Gemini 3.7 專注開發任務、GPT-5.6 測試超高推論速度、dots3-note 開源 280B 智慧體

August 14, 2026
Updated Aug 14
5 min read
gemini
AI日報|Gemini 3.7 專
google
ash — Google DeepM
deepmind
oogle DeepMind 一言以蔽之
minimax
ch 報導 MiniMax Music
comfyui
單曲創作與 ComfyUI 本地部署。
openai
快模式 — OpenAI / Cer
news
AI日報|Gemini 3.7 專注開發任務、GPT-5.6 測試超高推論速度、dots3-note 開源 280B 智慧體
2026-08-14

AI日報|Gemini 3.7 專注開發任務、GPT-5.6 測試超高推論速度、dots3-note 開源 280B 智慧體

最近的 AI 圈幾乎沒讓人有喘息的空間。從基礎模型的迭代到開發工具的整合,以下是近期幾項值得關注的技術發布與實務應用細節。

快訊

模型發布/更新

Gemini 3.7 Flash — Google DeepMind

  • 一言以蔽之:Google DeepMind 突襲發布新一代主力模型 Gemini 3.7 Flash,主打程式設計與 AI Agent 任務,且 API 價格較 3.6 Flash 直接砍半。
  • 核心亮點
    • Agent 執行穩定度提升:顯著最佳化長鏈條工具呼叫(Tool Calling)與多步驟邏輯,降低 AI Agent 在複雜自動化任務中偏離軌道的機率。
    • 價格降幅達 50%:輸入 Token 每百萬 $0.75 美元,輸出 Token 每百萬 $3.75 美元,大幅降低大規模部署成本。
  • 技術規格:閉源旗艦工作模型 / 支援多模態與程式設計 / API 與 AI Studio 同步上線
  • 傳送門Google DeepMind 官方部落格

Palmyra X6 — Writer

  • 一言以蔽之:企業級 AI 平臺 Writer 發布新旗艦模型 Palmyra X6,基於 GLM-5.2 開源底座建構並升級 Agent 框架,助企業大幅控制 Token 成本。
  • 核心亮點
    • 大幅削減營運成本:結合專屬 Agent 框架與模型最佳化,在標準企業任務中可協助客戶減少高達 50% 的 Token 支出。
    • 高效能長文字推理:針對長篇企業檔案解析與複雜流程自動化進行深度微調。
  • 技術規格:企業級閉源旗艦模型 / 基於 GLM-5.2 開源底座微調 / 支援長 Context Window
  • 傳送門TechCrunch 報導

MiniMax Music 3.0 — MiniMax

  • 一言以蔽之:MiniMax 正式開源 Music 3.0 生產級音樂生成模型權重,支援一次性完成最長 5 分鐘的全套單曲創作與 ComfyUI 本地部署。
  • 核心亮點
    • 端到端音樂製作:使用者只需提供簡單提示詞或歌詞,即可一步完成作曲、編曲、樂器演奏與混音製作。
    • 開放權重與生態支援:模型權重完全開放,且即日支援在 ComfyUI 中進行本地端推論。
  • 技術規格:開放權重音樂模型 / 最長支援 5 分鐘音樂生成 / 原生支援 ComfyUI 生態
  • 傳送門MiniMax 官方部落格

dots3-note-prev — dots-studio

  • 一言以蔽之:dots-studio 開源 dots3 系列首款開放權重 MoE 模型 dots3-note-prev,具備 280B 總引數與 512K 超長上下文,支援全模態理解。
  • 核心亮點
    • 高效 MoE 架構:總引數 280B,動態啟用 16B 引數,在效能與推論成本之間取得極佳平衡。
    • 原生全模態支援:同時支援文字、影像、影片與音訊輸入,特別針對工具呼叫與長文字檢索進行最佳化。
  • 技術規格:280B 總引數 (16B 啟用) / 開放權重 MoE 模型 / 512K Context Window / 原生多模態
  • 傳送門Hugging Face 模型頁面

dots.tts 語音合成模型 — 小紅書 dots 團隊

  • 一言以蔽之:小紅書團隊開源 20 億引數連續自迴歸語音合成模型 dots.tts,在 Seed-TTS-Eval 評測中取得頂尖內容準確度與語音相似度。
  • 核心亮點
    • 連續端到端架構:採用全連續端到端自迴歸設計,有效消除傳統語音合成中的發音斷字與音色漂移。
    • 高擴充套件性語音基座:為開源社群提供高品質、可靈活微調的語音合成(TTS)基礎模型。
  • 技術規格:2B 引數 / 開放權重語音模型 / 連續端到端自迴歸架構
  • 傳送門官方微信專文

產品發布/更新

GPT-5.6 Sol Ultrafast 超快模式 — OpenAI / Cerebras

  • 更新內容:OpenAI 推出 GPT-5.6 Sol 的 /ultrafast 限量預覽模式。由 Cerebras 算力晶片強勢驅動,輸出速度最高達 750 Token/秒(提升達 14 倍)。在 HLE 等極速推理測試中,響應速度超越同級競爭對手近 7 倍。
  • 適用人群:高頻 API 開發者 / 即時 AI Agent 工作流團隊 / 對推論延遲極度敏感的企業使用者
  • 體驗通道OpenAI 官方公告

ChatGPT 桌面端「電腦歷史記憶 (Computer History)」 — OpenAI

  • 更新內容:OpenAI 為 macOS 版 ChatGPT 推出 Computer History 功能。ChatGPT 能在本地記錄使用者跨應用程式與網站的操作軌跡(如點選、輸入等),並自動建立脈絡記憶,讓未來的對話互動無需反覆解釋背景情境。
  • 適用人群:Mac 重度辦公族 / 多工處理者 / 知識工作者
  • 體驗通道

DeepSeek Harness v0.1 AI Agent 框架 — DeepSeek

  • 更新內容:DeepSeek 以 MIT 許可證開源 DeepSeek Harness v0.1 AI Agent(AI Agent)框架。採用「一切皆外掛」的核心設計,將模型、工具、技能、沙盒與檔案系統全面模組化,開發者可自由替換與擴充套件,並支援會話日誌完全回放。
  • 適用人群:AI Agent 架構師 / 開源社群開發者 / 自動化工作流建構者
  • 體驗通道

Claude Code v2.1.232 與預設 Subagent Forking — Anthropic

  • 更新內容:Anthropic 發布 Claude Code v2.1.232,預設啟用子 Agent(Subagent)分支分割,允許子代理繼承完整的對話脈絡與 Prompt 快取;同時新增 GitLab 金鑰脫敏與外掛市場對 GitLab 倉庫的支援,並修正多項系統安全漏洞。
  • 適用人群:全棧工程師 / DevOps 團隊 / 使用 GitLab 的企業開發者
  • 體驗通道GitHub Release 頁面

Cursor Builds 預建環境功能 — Cursor

  • 更新內容:Cursor 推出 Builds 功能,能在背景預先準備好雲端開發環境副本。當喚醒雲端 AI Agent 時免去從零搭建環境的等待時間,整體啟動速度最高提升 3 倍、首個 Token 生成快 3 倍,且不額外收取費用。
  • 適用人群:使用 Cursor 雲端 Agent 的軟體工程師 / 團隊協作開發者
  • 體驗通道Cursor 官方部落格

Google Sheets Canvas 互動式迷你應用 — Google Workspace

  • 更新內容:Google Sheets 推出 Sheets Canvas 功能,整合 Gemini AI 能力。使用者只需輸入自然語言提示詞,即可將試算表內的冰冷資料直接轉換為互動式儀錶板、學習追蹤器、座位表等「迷你應用程式(Mini Apps)」。
  • 適用人群:資料分析師 / 專案管理者 / 辦公族與教育工作者
  • 體驗通道Google 官方部落格

產業動態

Dynatrace 宣佈收購 Arize AI,進一步升級 AI 可觀測性平臺 — Dynatrace / Arize AI

  • 事件概述:AI 可觀測性與評測平臺 Arize AI 宣佈已與 Dynatrace 達成最終收購協議。隨著 AI Agent 深入企業生產環境,AI 系統與軟體架構深度交織,兩者結合將打造價值 140 億美元的全面可觀測性巨頭。
  • 影響分析:標誌著「AI 可觀測性(AI Observability)」正式從新創分化領域併入傳統 Enterprise IT 可觀測性主戰場,未來 LLM/Agent 監控將成為企業 IT 基礎設施的標準配備。
  • 新聞連結

Anthropic 獲 Broadcom 等支援,推動 500 億美元美國算力建設計畫 — Epoch AI / Anthropic

  • 事件概述:Epoch AI 最新分析指出,年化收入約 90 億美元的 Anthropic 正推進高達 500 億美元的美國算力建設。其中 345 億美元算力專案中有 300 億獲得 Broadcom 的融資支援,融資結構展現出市場對 2028 年前超 20GW 算力部署的強烈信心。
  • 影響分析:前沿 AI 巨頭正擺脫純股權融資限制,轉向由晶片與基礎設施巨頭擔保的創新專案融資模式,大幅加速算力叢集規模的擴充速度。
  • 新聞連結

X (Twitter) 以 Apache v2 協議開源「為你推薦」演演演算法原始碼 — X / Elon Musk

  • 事件概述:X 平臺正式以 Apache v2 授權條款開源其「為你推薦 (For You)」時間線排名演演演算法原始碼。該演演演算法基於點讚、回覆、停留時間等加權機率預測進行綜合評分,新帳號可獲得初期流量扶持,重複內容則會被降權。
  • 影響分析:社交巨頭持續推動推薦演演演算法透明化,開原始碼有助於 AI 社群研究大規模即時推薦系統與對抗式內容過濾機制。
  • 新聞連結

論文研究

CLAUDE.md 指令膨脹研究:AI Agent 程式設計中的「災難性記憶」 — AI Research Group

  • 研究動機:探討為何 AI Agent 在專案中的系統指令檔(如 CLAUDE.md)會隨時間持續膨脹,進而導致提示詞浪費與 Agent 執行邏輯紊亂。
  • 核心創新:分析 1,867 個 GitHub 倉庫後提出「災難性記憶(Catastrophic Memory)」概念:使用者傾向不斷疊加新規則卻極少刪減舊條款。論文提出為每條指令附帶「緣由註釋(Rationale Annotations)」的約束方法。
  • 研究成果:在 51 步 IFEval 基準測試中,加入緣由註釋能將多餘提示詞的膨脹率從 +211.3% 驟降至 +1.4%,顯著抑制 Prompt 膨脹問題。
  • 論文地址

其他分享

無訓練純演演演算法部署:在 Transformer 權重中執行 DOOM 遊戲 — Reddit / LocalLLaMA

  • 內容簡介:開發者透過自研編譯器 torchwright,將 DOOM 遊戲的渲染演演演算法直接轉譯為 Transformer 模型的神經網路權重(完全無須訓練學習)。透過 Phi3 結構,輸入玩家位置與視角,模型即可直接輸出渲染指令並繪製畫素畫面,並已在 Hugging Face 開源 80x50 與 320x200 權重檔。
  • 傳送門Reddit 社群討論

1. Google 推出 Gemini 3.7 Flash:重點放在程式碼與代理任務

距離 3.6 版本發布僅隔三週,Google 就端出了 Gemini 3.7 Flash。這次的更新目標很明確,主要是針對軟體工程、知識工作與網頁開發的處理流程。

官方評測數據: 根據 Google 公布的資料,3.7 Flash 在 FrontierCode 1.1 Main 的程式碼測試中拿到了 43.6%(前代為 34.4%)。在涉及網頁前端開發的 WebDev Arena 評測中,Elo 分數從 1538 提升至 1588。官方也展示了該模型能直接從設計截圖生成具備互動功能的網頁版面。

值得注意的是計費方式。Google 打出了價格戰,今年底前每百萬輸入/輸出 token 為 0.75 / 3.75 美元,這剛好是 3.6 Flash 常規價格的一半(兩者的上市推廣優惠價相同)。開發者現在已經可以透過 Google AI Studio 或 Android Studio 進行串接。

2. MiniMax Music 3.0 開源:挑戰五分鐘長曲生成

AI 寫歌最怕遇到唱到一半樂器消失,或是段落之間情緒斷層。MiniMax Music 3.0 試圖解決這個問題,而且團隊已經將模型權重開源到 GitHubHugging Face

在架構上,他們沒有依賴單一模型,而是用了「全局與局部」的分工策略。一個 8B 的模型負責看「大局」,跨時間維度處理整首歌的語義與情感;另一個 0.6B 的模型則專注處理局部的聲音細節。這兩者的連續向量會直接融合送入流匹配(Flow-Matching)模組。實際的結果是,模型在處理長達五分鐘的曲目時,人聲換氣與旋律的銜接變得比較自然。

3. dots3-note Preview:加入自我評估機制的開源模型

dots studio 釋出了採用 Apache 2.0 協議的 dots3-note Preview。這是一個 280B 參數(激活 16B)的模型,支援 512K 上下文。

這項發布最大的看點是他們提出的 TEMPO 訓練演算法。處理長程任務時,AI 通常很難知道自己現在做得到底對不對。TEMPO 的解法是讓模型「換腦袋」:把任務切成好幾個階段,每完成一個階段,智慧體就會從「執行者」變成「評論者」。它會利用推論階段的算力,自己評估當前進度並修正方向。官方表示,除了訓練階段,團隊在推理階段也利用類似的自我評價機制,基於其分支模型建構遞迴生成與驗證的測試框架,最終在 IMO 2026 中取得了官方認證的 42/42 滿分金牌成績

4. Claude Tag 升級:開始學會「看場合」

Anthropic 針對 Slack 整合工具 Claude Tag 做了更新。以前的 Claude 比較像在單點回覆訊息,現在它能讀取整個頻道的上下文與長期記憶。

這項更新改變了機器人介入對話的方式。它現在會判斷情況來決定動作:如果問題很單純,它就直接回覆;如果需要除錯,它會自己開一個 Thread 並標註工程師;如果大家已經聊得很熱絡且分工明確,它會選擇保持沉默。這項功能目前已向 Teams 及 Enterprise 用戶開放,Anthropic 表示背景閱讀的 token 不會計入使用額度。

5. Google Sheets canvas:把試算表變成儀表板

Google 在 Workspace 中加入了 Sheets canvas。簡單來說,這是直接覆蓋於試算表數據之上的一層互動介面。

你不需要寫公式,只要在側邊欄對 Gemini 下指令(例如「建立庫存追蹤面板」),它就會生成視覺化的圖表與控制元件。因為是連動的,你在畫布上拖曳修改的數據,原本的儲存格也會跟著變更。這功能目前正陸續推送給商業版與企業版用戶。

6. GPT-5.6 Sol Ultrafast:拼延遲與輸出速度

OpenAI 針對企業客戶預覽了 Ultrafast 推論模式。依靠 Cerebras 的專屬硬體,官方測試顯示 GPT-5.6 Sol 的輸出速度可達每秒 750 個 token。

速度拉到這個層次,主要針對的就不是一般寫作,而是對延遲極度敏感的商務場景。例如在系統當機瞬間即時掃描大量 Log 檔抓錯、金融系統的毫秒級交易異常判讀,或是讓 AI 語音客服在查詢系統資料時不會產生對話空白。

7. ChatGPT 新增電腦歷程記錄

OpenAI 預告了桌面版的 Computer History 功能。這主要是為了解決跨軟體工作時的痛點。ChatGPT 現在可以記住你在不同應用程式間的切換脈絡,也就是說,你不需要再頻繁地把 A 軟體的背景資訊複製貼上給它,它能主動結合前後情境給建議。

8. DeepSeek Harness v0.1 開放預覽

DeepSeek 開源了代理框架 DeepSeek Harness v0.1。這套基於 Cordis 建構的框架,主打「高度模組化」。從語言模型、沙盒環境到工作流調度,所有核心單元都是獨立的外掛。開發者可以直接用 Node.js 啟動本機端 Web UI,並依需求抽換底層元件。

9. Cursor Builds:縮短雲端代理暖機時間

每次啟動雲端開發環境都要等很久是個老問題。Cursor 推出的 Builds 功能,是讓系統在背景定時幫你把環境「暖機」備份好。當你需要啟動代理時,直接拿運行中的機器副本來用,省去下載套件跟建立環境的時間。官方宣稱這讓首個 token 輸出速度快了三倍。


問與答(Q&A)

Q1:Gemini 3.7 Flash 的計費有變嗎?

今年底前半價優惠。每百萬輸入 0.75 美元,輸出 3.75 美元,相當於常規原價的一半。2027 年 1 月 1 日就會恢復成常規原價(輸入 1.50 美元,輸出 7.50 美元)。

Q2:MiniMax Music 3.0 是怎麼解決長曲容易崩壞的問題?

他們讓兩個模型分工。8B 的大模型負責管整首歌的骨架與情感,避免段落亂掉;0.6B 的小模型負責處理局部的聲音細節。這讓五分鐘的歌曲在旋律與人聲換氣上能保持連貫。

Q3:dots3-note 的 TEMPO 演算法跟傳統強化學習差在哪?

傳統強化學習很難評估需要花幾十個小時才能做完的任務。TEMPO 把長任務切成好幾塊,每完成一塊,AI 就會利用推論算力去預測「這條路走不走得通」,及時修正方向,而不是瞎走到最後才發現錯了。

Q4:Claude Tag 讀取 Slack 整個頻道的歷史訊息,會不會很燒錢?

Anthropic 表示,這些為了建立背景脈絡而消耗的 token,不會計入 Teams 或 Enterprise 方案的使用量額度。

Q5:Cursor Builds 如果剛好把環境裝壞了怎麼辦?

遇到代碼提交錯誤或套件相衝導致建置失敗時,系統不會套用那個壞掉的環境,而是會自動退回上一次成功建置的紀錄,讓你可以繼續工作。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.