此文章是自動產生,於每天早上九點自動更新。
AI 日報|Qwen3.8-Max 與 MiniMax H3 重磅發布;OpenAI 揭露 Astra 解題能力與 GPT-Live 實時語音
模型發布/更新
MiniMax H3 — MiniMax (海螺 AI)
- 一言以蔽之:MiniMax 正式開源新一代全模態影片生成模型 H3,可統一理解文字、影像、影片與音訊,登頂 Video Arena 開源影片模型第 1 名。
- 核心亮點:
- 支援生成最高 2K 解析度、最長 15 秒、帶 32 kHz 原生立體聲音訊的影片。
- 在 Video Arena 中文生影片與圖生影片雙項登頂開源首位,得分較第二名開源模型高出 280 分。
- 技術規格:開源權重 (Hugging Face) / 2K 24FPS 15 秒 / Video Arena 開源 SOTA
- 傳送門:Hugging Face 儲存庫
Astra (下一代主要模型內部版) — OpenAI
- 一言以蔽之:OpenAI 揭露下一代主力模型「Astra」內部版本,僅花費約 2,000 美元 API Token 成本即成功解決 10 個長期開放的數學與理論電腦科學難題。
- 核心亮點:
- 涵蓋球體填充、編碼理論、群論、量子複雜度與格密碼學等前沿領域。
- 所有解答均附帶完整的 Lean 形式化證明證書,展示了 AI 進行深層推理與科學發現的巨大潛力。
- 技術規格:閉源 / 附 Lean 形式化證明證書
- 傳送門:OpenAI 官方部落格
SenseNova U1.5-Lite-Preview — 商湯科技
- 一言以蔽之:商湯發布基於 NEO-Unify 架構的輕量級原生統一多模態模型,僅 8B-MoT 引數即達到商業閉源模型的生成與編輯品質。
- 核心亮點:
- 採用原生統一多模態架構,大幅降低記憶體佔用與推理成本。
- 保持高品質影像生成與編輯能力,適合部署於邊緣端或輕量級服務。
- 技術規格:8B-MoT 引數 / 開源 Preview / 統一多模態架構
- 傳送門:
𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1.5-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄.
— SenseTime (@SenseTime_AI) August 3, 2026
An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝗪𝗶𝘁𝗵… pic.twitter.com/sq7gFcLGER
jina-reranker-v3.5 — Jina AI
- 一言以蔽之:Jina AI 發布 0.6B 輕量級重排序模型 v3.5,以 7 倍少的引數量在 BEIR 基準測試中擊敗 Qwen3-Reranker-4B。
- 核心亮點:
- 在 BEIR 測試中取得 63.20 nDCG@10 的優異成績。
- 兼具超高運算速度與卓越的企業檢索品質,成功確立效能與尺寸的帕累託前沿(Pareto Front)。
- 技術規格:0.6B 引數 / 開源 (Hugging Face) / BEIR 63.20 nDCG@10
- 傳送門:Jina AI 官方部落格
產品發布/更新
ChatGPT Continuous Voice Interaction (GPT-Live) — OpenAI
- 更新內容:OpenAI 重構 ChatGPT Voice 語音架構,推出 GPT-Live,支援使用者與 AI「邊聽邊說」,且深層推理與工具呼叫不會打斷對話。語音對話建立時間從 6 個網路往返縮短至 1 個,帶來極低延遲的自然流暢對話體驗。
- 適用人群:ChatGPT 使用者 / 語音 AI 開發者 / 行動端使用者
- 體驗通道:OpenAI 官方部落格
@cloudflare/computer AI Agent 執行時預覽版 — Cloudflare
- 更新內容:Cloudflare 推出
@cloudflare/computer開源執行時,為每個 AI Agent 提供獨立的虛擬檔案系統與多元執行環境(Isolate / 容器沙箱 / 瀏覽器)。基於 Durable Objects 與 SQLite 持久化,讓 Agent 具備長效工作空間並可在多種環境間動態切換。 - 適用人群:AI Agent 開發者 / 雲端架構師 / 全棧工程師
- 體驗通道:Cloudflare 官方部落格
Next.js 16.3 正式版 — Vercel
- 更新內容:Vercel 釋出 Next.js 16.3,推出 Instant Navigations 打造單頁應用級極速響應,並原生最佳化 AI Agent 開發體驗。開發伺服器與 Build 速度大幅提升,並提供內建版本化檔案等 Agent 友善開發工具。
- 適用人群:前端工程師 / Web 開發者 / AI 輔助開發團隊
- 體驗通道:Next.js 官方部落格
v0 API 程式化應用建置 — Vercel
- 更新內容:Vercel 推出全新 v0 API,允許開發者透過程式碼直接呼叫 v0 的應用建置能力。支援從 Prompt、Git 儲存庫或 ZIP 檔案啟動對話、渲染開發伺服器預覽、傳送續寫指令並一鍵部署至 Vercel。
- 適用人群:自動化工作流架構師 / AI 軟體工廠開發者 / 獨立開發者
- 體驗通道:
Introducing the new v0 API.
— v0 (@v0) August 3, 2026
Programmatic access to v0's app-building capabilities:
• Start a chat from a prompt, repo, or ZIP
• Render a dev server preview
• Send follow-up messages
• Deploy to Vercel pic.twitter.com/L7zJulyglS
ElevenAgents 企業級語音 AI Agent 平臺 — ElevenLabs
- 更新內容:ElevenLabs 推出 ElevenAgents 平臺,每週處理超過 1,000 萬次自然語音對話。提供可配置的護欄與區域資料儲存選項,並結合 Spotlight 監控生產環境對話,主動給出最佳化建議。
- 適用人群:企業客服團隊 / 語音 AI 開發者 / IT 負責人
- 體驗通道:
More than 10 million conversations run on ElevenAgents every week.
— ElevenLabs (@ElevenLabs) August 3, 2026
In each one, a natural-sounding voice or chat agent handles a real interaction like a refund request, appointment booking, benefits inquiry, or flight change.
See the platform that makes them possible. pic.twitter.com/COee1hqn3l
GenOffice 開源 AI 辦公套件 — Genspark
- 更新內容:Genspark 開源跨平臺 AI 辦公套件 GenOffice,完全免費且無廣告。支援 Docs、Sheets、Slides 與 PDF 編輯,內建 Genspark Super Agent 能自主完成資料研究、表格資料分析並自動產出簡報與檔案。
- 適用人群:辦公族 / 學生 / 企業團隊 / 獨立創作者
- 體驗通道:
Open-sourcing GenOffice!! Free for everyone.
— Eric Jing (@ericjing_ai) August 3, 2026
A full-featured AI Office for PC and Mac. We invite you to build the future of a native AI office experience together! https://t.co/rcvKpLTPRp
產業動態
歐盟《人工智慧法案》合成內容透明度條款正式生效
- 事件概述:歐盟《人工智慧法案》(EU AI Act)的新透明度規定於 8 月 2 日正式上路,強制要求企業揭露使用者是否正在與 AI 互動,並為 AI 生成的聲音、影像與文字嵌入機器可讀的標記。
- 影響分析:違規企業最高可能面臨 1,500 萬歐元或全球年營業額 3% 的鉅額罰款,這將加速全球生成式 AI 內容發布平臺規範合成水印與邊界標示。
- 新聞連結:The Verge 報導
Palantir 第二財季營收飆升 93%,CEO Alex Karp 批評前沿 AI 實驗室呈「馬克思主義」色彩
- 事件概述:Palantir 公佈第二財季營收達 19 億美元(年增 93%),淨利潤達 11 億美元。CEO Alex Karp 在股東信中警告,前沿 AI 實驗室企圖「佔有合作夥伴的生產資料」,強調 Palantir 將堅持提供與模型無關(Model-agnostic)的獨立 AI 基礎設施。
- 影響分析:突顯出企業客戶對模型廠商「既合作又擔心資料被挾持」的矛盾心態,也驗證了中間層編排與隱私資料掌控軟體的巨大市場價值。
- 新聞連結:TechCrunch 報導
AWS 與 Superblocks 合作將 Vibe-Coding 引進企業私有雲
- 事件概述:AWS 與 AI 軟體開發平臺 Superblocks 達成多年合作,將 Superblocks 的 Vibe-Coding 程式設計工具直接嵌入 AWS 客戶的私有雲環境中,自動建立 Amazon Aurora 資料庫並整合 Amazon Bedrock。
- 影響分析:解決了傳統大型企業在匯入 AI Agent 輔助程式設計時最擔心的資料外洩與資安合規問題,讓企業級生成式軟體開發邁向私有化落地。
- 新聞連結:TechCrunch 報導
論文研究
Orchard 開源 AI Agent 跨任務訓練框架 — 微軟研究院 (Microsoft Research)
- 研究動機:目前的 AI Agent 訓練與評估框架高度碎片化,缺乏統一且能直接連結真實部署 Harness(如 Codex、OpenClaw)的環境服務。
- 核心創新:微軟發表 Orchard 框架,透過 Orchard Env 建立可複用的環境服務,讓小型開源模型也能在真實程式碼與 Web 導航任務中獲得訓練。
- 研究成果:旗下的 Orchard-SWE 僅需約 3B 啟用引數,即在 SWE-bench Verified 榜單取得 69.7%(重排序後達 73.0%)的亮眼成績,媲美體積大上 10 倍的前沿閉源模型。
- 論文地址:Microsoft Research 部落格
Meta GEM 訓練架構:LLM 規模下的廣告推薦基礎模型 — Meta
- 研究動機:將 LLM 規模的 GPU 訓練技術直接套用到傳統推薦系統時,經常面臨架構與資料特性不相容導致的硬體利用效率低下問題。
- 核心創新:Meta 針對 GEM 推薦基礎模型進行了 Kernel、精度、平行化策略與記憶體的軟硬體協同設計(Hardware/Software Co-design)。
- 研究成果:在 12 個月內將訓練 FLOPs 擴大 4 倍的同時,成功將端到端訓練效率(MFU)翻倍提升至 20–25%,極大地降低了大模型規模推薦系統的算力成本。
- 論文地址:Meta 工程團隊部落格
其他分享
Hermes Agent v0.20.0 與 NVIDIA NeMo Relay 合作推出全方位最佳化
- 內容簡介:Nous Research 釋出 Hermes Agent v0.20.0,結合 NVIDIA NeMo Relay 針對小型與邊緣模型進行系統級最佳化。透過工具呼叫流程改進、Schema 簡化與對話軌跡分析,大幅減少了任務完成所需的對話輪數與 Token 消耗。
- 傳送門:GitHub Release 頁面
長上下文導致對話質量退化的解決方案:Markdown 摘要壓縮法
- 內容簡介:著名學者 Ethan Mollick 針對長上下文模型出現的「固執」、「指令忽視」等對話退化現象提出建議。由於 AI 無法準確察覺自身的退化狀態,使用者不應直接向 AI 詢問狀況,而是應定期將當前進度與脈絡壓縮為獨立的 Markdown 摘要檔案,並開立全新 Session 繼續對話。
- 傳送門:
Nate is right (full context can lead to a degradation of chats in several different ways) but you can't ask the AI about stuff like this as they have bad self-knowledge
— Ethan Mollick (@emollick) August 3, 2026
A good approach is to compact the work so far (ask for a md file summarizing things) & use it in the new chat https://t.co/2U11vnXLDk



