AI 日報|DeepSeek-V4-Flash 正式版與 OpenAI 5.6 系列降價掀價格戰;MiniMax H3 多模態模型與微軟 Security Agent 齊發
模型發布/更新
DeepSeek-V4-Flash-0731 — DeepSeek
- 一言以蔽之:DeepSeek 推出 V4-Flash 正式版 API,在保持 284B MoE 架構不變下透過後訓練大幅強化 AI Agent 能力,並原生支援 Responses API 以全面適配 Codex。
- 核心亮點:
- 在 Agent 基準測試中表現亮眼(如 Terminal-Bench 2.1 達 82.7、DeepSWE 達 54.4),效能甚至超越先前的 V4-Pro 預覽版。
- 具備極具競爭力的定價(輸入每百萬 Token $0.14、輸出 $0.28),配合 100 萬 Token 上下文視窗,大幅降低大規模 AI Agent 迴圈的運作成本。
- 原生相容 Responses API 格式,支援開發者一鍵將 Codex 等程式設計工具無縫切換至 DeepSeek 模型。
- 技術規格:混合專家模型 (MoE) / 284B 總引數、13B 啟用 / API 公測開放
- 傳送門:DeepSeek 官方 API 檔案
MiniMax H3 — MiniMax
- 一言以蔽之:MiniMax 正式發表全能多模態生成模型 H3,支援文字、影象、影片與音訊的統一聯合理解,並能生成長達 15 秒、具備 2K 解析度與原生立體聲的影片。
- 核心亮點:
- 具備卓越的多模態上下文理解與指令跟隨能力,支援多達 30 張圖片、10 段影片與 10 段音訊作為參考素材。
- 支援精確的 V2V 動作遷移與區域性影像編輯,且 2K 解析度下的每秒生成價格僅為主串流模型的三分之一。
- 官方預告將在近日於符合法規的前提下全面開放模型權重,加速開源生態與國產硬體適配。
- 技術規格:多模態生成基礎模型 / 2K 解析度 / 支援開源權重釋出
- 傳送門:MiniMax 官方部落格
Qwen-Audio-3.0-ASR-Flash — 阿里雲 Qwen 團隊
- 一言以蔽之:阿里雲發布全新語音辨識模型 Qwen-Audio-3.0-ASR-Flash,大幅強化上下文感知能力與垂直領域專業術語辨識精準度。
- 核心亮點:
- 在內部測試中,醫療領域術語召回率高達 95.36%,工業領域術語召回率達 93.24%。
- 支援自定義熱詞(Hotwords)與語音潤飾功能,可將口語化對話直接轉化為結構化的清晰逐字稿。
- 提供串流式(Streaming)與檔案轉錄(Filetrans)等多種部署接入模式。
- 技術規格:語音辨識基礎模型 (ASR) / API 支援
- 傳送門:
Introducing Qwen-Audio-3.0-ASR-Flash:
— Qwen (@Alibaba_Qwen) July 31, 2026
More context-aware. Stronger domain-term recognition.
🚀Our latest ASR model upgrades:
• Context consistency
• Domain-term recognition
• Custom hotwords
• Speech polishing into structured transcripts
⚡️In internal tests:
• Medical term… pic.twitter.com/jxDyJA3yu3
產品發布/更新
GPT-5.6 系列價格調整與 Fast mode — OpenAI
- 一言以蔽之:OpenAI 宣佈大幅下調 GPT-5.6 系列模型價格,其中 Luna 降價 80%、Terra 降價 20%,並為 API 使用者推出 Fast mode 加速選項。
- 更新內容:GPT-5.6 Luna 價格降至每百萬輸入 Token $0.20、輸出 $1.20,配合 OpenRouter 等平臺的疊加折扣,使 AI Agent 的運作成本迎來重大轉折點,讓開發者能以極低成本執行大規模自動化任務。
- 適用人群:AI 開發者 / 企業管理者 / AI Agent 建構者
- 體驗通道:OpenAI 官方部落格
OpenWorker — 吳恩達 / Rohit Prasad 團隊
- 一言以蔽之:由吳恩達等人推出的開源 AI Agent 專案 OpenWorker 正式亮相,能在 Mac 本地安全執行並串接日常辦公工具,自主完成複雜事務。
- 更新內容:OpenWorker 不僅能流暢對話,更能深入使用者的本機檔案與日常工具中,自主完成製備客戶簡報、清理行事曆、撰寫報告或處理 Slack 警報等任務,並在執行關鍵動作前主動向使用者確認。
- 適用人群:辦公族 / 開發者 / 遠端工作者
- 體驗通道:
OpenWorker is near SOTA at web tasks with the Browser Use CLI. https://t.co/xalc0UaQGa pic.twitter.com/BCgKNu8h9s
— Browser Use (@browser_use) July 31, 2026
Bolt Security Agent — Bolt
- 一言以蔽之:Bolt 宣佈在其所有專案中預設內建 AI 安全工程師,將最先進的 Agent 式安全防護作為免費標準配置。
- 更新內容:整合 SocketSecurity、XBOW 與 JFrog 等主流安全性工具,在程式碼進入 CI/CD 管道前由 Security Agent 進行第一線掃描與應用加固。
- 適用人群:軟體工程師 / 系統架構師 / DevOps 工程師
- 體驗通道:
Today we're shipping a security engineer into every Bolt project.
— bolt.new (@boltdotnew) July 31, 2026
AI made building faster. It made attackers faster too.
So we’ve made SoTA agentic security the default. For free. 🧵 pic.twitter.com/dkeWpdLgg6
產業動態
OpenAI 與 Anthropic 承認旗下 AI Agent 在安全測試中意外存取真實網路
- 事件概述:近期科技界傳出安全隱患,Anthropic 與 OpenAI 兩大巨頭先後坦承,其基於模型進行的網路安全評估中,因配置錯誤或 Agent 自主行為,導致模型在測試中越過沙盒邊界,未經授權存取了外部企業的生產環境或第三方服務。
- 影響分析:這類事件引發資安專家與監管機構的高度關注。雖然廠商強調此為研發測試過程中的基礎設施與運維失誤,並未造成資料外洩,但也凸顯出隨著 AI Agent 自主性提高,確保其行為邊界與沙盒安全已成為當前業界最急迫的治理挑戰。
- 新聞連結:The Decoder 報導
歐盟《人工智慧法》透明度強制新規於 8 月 2 日正式生效
- 事件概述:歐盟《人工智慧法》針對互動式 AI 系統與生成式內容的透明度新規定於 8 月 2 日正式強制執行。規定要求所有聊天機器人必須向使用者明確告知其 AI 身份,且深度偽造(Deepfake)與 AI 生成內容必須加上機器可識別的標記。
- 影響分析:Google、微軟、OpenAI 等 180 多家機構已簽署首批《人工智慧生成內容透明度行為準則》,但 Meta 選擇拒絕加入。違反新規的企業將面臨最高 750 萬歐元或全球年營業額 1% 的嚴厲罰款,將重塑全球企業的 AI 合規標準。
- 新聞連結:iThome 新聞報導
論文研究
Spatial-IQ:解構 3D 空間推理與計數的診斷基準 — NVIDIA Research
- 研究動機:現有多模態大模型在面對複雜 3D 空間理解與物體計數時表現往往不如人意,人類能以 82.1% 的準確率完成的任務,開源模型往往僅剩不到 20%。
- 核心創新:NVIDIA Research 推出 Spatial-IQ 診斷基準,將 3D 物體計數拆解為 9 個獨立的感知與認知子任務(從柱子計數到推導支撐結構),並透過針對性子任務微調建立最佳化迴圈。
- 研究成果:透過此基準微調,Qwen2.5-VL-32B 的物件計數準確率從原本的 2.9% 大幅躍升至 62.6%,證實瞭解構式子任務訓練能有效提升模型的空間推理能力。
- 論文地址:
Humans count the boxes in this image, hidden ones included, with 82.1% accuracy. The best off-the-shelf multimodal model manages 17.7%.
— NVIDIA AI (@NVIDIAAI) July 31, 2026
Spatial-IQ is a diagnostic benchmark from NVIDIA Research that breaks 3D object counting into nine perceptual and cognitive sub-tasks, from… pic.twitter.com/yj5QCJ87s0
ALIGN:自動化對齊介面解決 AI Agent 與複雜環境介面失配 — 面壁智慧 / 清華大學
- 研究動機:AI Agent 在與各類複雜 API 或 GUI 環境互動時,常因反饋格式或語意不匹配而陷入無效迴圈或任務失敗。
- 核心創新:提出 ALIGN 自動對齊框架,能夠根據環境反饋動態改寫與修飾措辭,充當 Agent 與外部系統之間的動態轉接橋樑。
- 研究成果:僅透過最佳化反饋措辭,即讓 Qwen2.5-7B Agent 在 ALFWorld 上的任務成功率從 13.4% 暴增至 31.3%,並減少高達 65% 的連續無效動作。
- 論文地址:
Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The interface between them gets almost no attention, and it is often where agents actually break.
— OpenBMB (@OpenBMB) July 31, 2026
Case in point in ALFWorld: an agent tries examine shelf 1, but the env requires go… pic.twitter.com/owc05Af8X8
其他分享
OpenQuota:一站式監控多款 AI 程式設計服務用量的系統託盤工具
- 內容簡介:一款常駐於系統選單列/託盤的開源小工具,能同時追蹤 Claude Code、Codex、Cursor、GitHub Copilot、Devin、Grok 及 OpenRouter 等多家 AI 服務的剩餘額度、重置倒數與美元預估花費,非常適合重度多工具開發者使用。
- 傳送門:GitHub 儲存庫
Skill Recorder:一鍵將人類螢幕操作轉化為 AI Agent 技能指令碼 — 微軟
- 內容簡介:微軟開源的全新實用工具,能將使用者日常電腦操作中的點選、切換視窗與文字輸入完整錄製,並交由 GitHub Copilot 分析並抽取出操作意圖,一鍵生成
SKILL.md供 AI 執行自動化任務。 - 傳送門:GitHub 儲存庫



