AI日報|OpenAI 發布 GPT-5.6 系列模型、Grok Voice Think Fast 2.0 推出語音功能、Replit Design 上線
模型發布/更新
Lyria 3.5 — Google DeepMind
- 一言以蔽之:Google DeepMind 發表新一代音樂生成模型 Lyria 3.5,全方位提升旋律、歌詞、人聲表現力與精確 BPM 創作控制。
- 核心亮點:
- 具備更強的旋律結構意識與歌詞提示詞遵循能力,能生成豐富且具情感層次的真人般人聲。
- 支援精確設定 BPM 節奏並可直接匯出全曲分軌,同步於 Google Flow Music 登場。
- 技術規格:音樂生成多模態模型 / 閉源 API 服務
- 傳送門:Google DeepMind 部落格
Grok Voice Think Fast 2.0 — xAI
- 一言以蔽之:xAI 推出新一代語音模型 Grok Voice Think Fast 2.0,主打真實複雜場景下的超低延遲對話與抗噪能力。
- 核心亮點:
- 首段音訊平均回應時間僅 0.70 秒,在 Tau Voice AI Agent 測試中取得 56.5% 的業界最高分。
- 專為真實環境打造,能於高雜音環境中精準辨識語音並進行複雜工作流推理。
- 技術規格:語音對語音多模態模型 / API 定價為每小時 $4.80
- 傳送門:
Announcing Grok Voice Think Fast 2.0, our next-generation voice model with improved intelligence, transcription accuracy, and conversational capabilities.https://t.co/XUiX1CouKz pic.twitter.com/Nel3zwzkwY
— SpaceXAI (@SpaceXAI) July 29, 2026
GPT-5.6 Sol 自主最佳化與架構升級 — OpenAI
- 一言以蔽之:OpenAI 揭露 GPT-5.6 Sol 透過自我重寫 GPU 核心與推測解碼最佳化,成功為生產環境降低 20% 營運成本。
- 核心亮點:
- GPT-5.6 Sol 能自主進行架構實驗並重寫 GPU 核心,使 Token 生成效率大幅提升 15% 以上。
- 透過啟用保留推理過程(Reasoning Retention)與壓縮(Compaction)兩項 API 設定,在 ARC-AGI-3 基準測試中得分提升三倍。
- 技術規格:前沿推理模型 / API 閉源服務
- 傳送門:
These optimizations across our stack compound to unlock the most performant models at every point in the cost-intelligence curve. https://t.co/tcv8oo0z7G
— OpenAI (@OpenAI) July 29, 2026
產品發布/更新
Codex Security CLI & SDK — OpenAI
- 更新內容:OpenAI 開源 Codex Security CLI 與 TypeScript SDK,允許開發者直接呼叫 Codex 模型掃描整個程式碼儲存庫、git diff 或變更記錄,自動挖掘並驗證安全漏洞,可無縫整合至 CI/CD 流水線。
- 適用人群:軟體工程師 / 資安人員 / DevSecOps 團隊
- 體驗通道:GitHub 儲存庫
ChatGPT for Academic Researchers — OpenAI
- 更新內容:OpenAI 啟動學術研究者計畫,初期免費向 10,000 名數學家、科學家與工程師開放旗艦 GPT-5.6 系列模型,預計 2027 年擴充套件至 100,000 人,旨在加速跨學科科學研究與重大發現。
- 適用人群:大專院校學者 / 科學研究人員 / 博士後研究員
- 體驗通道:OpenAI 官方公告
Replit Design — Replit
- 更新內容:Replit 推出 AI 驅動的設計助手 Replit Design,讓非專業設計師也能透過自然語言描述產品,自動生成個性化且具備一致性的應用程式 UI/UX 設計與視覺資產。
- 適用人群:獨立開發者 / 產品經理 / 創業團隊
- 體驗通道:Replit 官方部落格
Cursor for iPad — Cursor
- 更新內容:熱門 AI 程式碼編輯器 Cursor 正式登上 iPad 平臺,提供廣闊的介面空間讓開發者與 AI Agent 協作,並新增內建收件匣與完整的 PR 審查(含留言與核准)體驗。
- 適用人群:行動開發者 / 前端工程師 / 軟體架構師
- 體驗通道:
Cursor is now on iPad.
— Cursor (@cursor_ai) July 29, 2026
All the power of Cursor on iPhone, with more room to work with agents. pic.twitter.com/BKzS0eTUjr
Numbat Agent 安全檢測層 — Perplexity
- 更新內容:Perplexity 開源單一 Go 二進位檔架構的安全工具 Numbat,能跨多種 AI Agent 框架提供行為可見性,並在違規操作執行前進行主動攔截與即時稽核。
- 適用人群:企業資安工程師 / AI 系統管理員 / 開源社群
- 體驗通道:GitHub 儲存庫
Looker Agentic Workflows — Google Cloud
- 更新內容:Google Cloud 於 Looker 中推出 Agentic Workflows 預覽版,能將傳統靜態的資料警報轉化為自動化的持續監控與根因分析(Root-Cause Analysis)流程。
- 適用人群:商業分析師 / 資料工程師 / 企業管理層
- 體驗通道:Google Cloud 官方部落格
產業動態
扎克伯格預測 5 年內數十億人將擁有個人 AI Agent
- 事件概述:Meta 執行長馬克·扎克伯格在 Q2 財報會議上預言,未來五年內將有數十億人擁有能 24/7 代表個人處理健康、財務與日常生活事務的專屬 AI Agent。同時 Meta 本季資本支出大幅飆升,自由現金流降至 7.84 億美元,並與 BlackRock 合作建設 1 GW 資料中心。
- 影響分析:顯示科技巨頭正全力將 AI 競爭點從「單次問答聊天」轉向「長期自主運作的 Agent 生態」,儘管短期對自由現金流造成巨大的資本支出壓力,但未來將深刻重塑消費與企業軟體市場。
- 新聞連結:TechCrunch 報導
Microsoft 確認今年將推出 Copilot「超級應用(Super App)」
- 事件概述:微軟執行長 Satya Nadella 在財報電話會議上證實,今年內將把聊天、程式碼編寫(Cowork/Autopilot)以及 AI Agent 能力統一整合成一款「超級應用」,同步覆蓋消費者與企業端體驗。
- 影響分析:微軟意圖打破過往分散在 Teams、Office 與獨立網頁的軟體介面,建立單一入口,強勢鞏固其在個人與企業 AI 助手市場的龍頭地位。
- 新聞連結:The Verge 報導
論文研究
AI Agent 的 Python 物件化架構研究 — NVIDIA
- 研究動機:傳統 Prompt 模板、工具模式與工作流圖易導致 AI Agent 行為不可預測且難以除錯與測試。
- 核心創新:主張將 AI Agent 構建為標準 Python 物件,透過方法、欄位、檔案字串與型別註解,明確在原始碼中劃清確定性邏輯與機率性行為的邊界。
- 研究成果:顯著提升 AI Agent 的可測試性、可追蹤性與可重構性,為開發生產級 AI Agent 提供了標準化的工程規範。
- 論文地址:
Super interesting new work from NVIDIA.
— elvis (@omarsar0) July 29, 2026
(bookmark it)
They suggest building agents as Python objects.
Very cool idea and I think it could a lot with agent reliability.
More below:
Agent development today spreads across prompt templates, tool schemas, callback code, and… pic.twitter.com/Bs9F5Zj4rQ
其他分享
OpenWorker 開源辦公 Agent 框架 — 吳恩達 / OpenWorker
- 內容簡介:由吳恩達團隊發布的輕量級桌面辦公 Agent 工具 OpenWorker 正式開源,僅需約 51 MB。它能連結 Slack、Notion、Gmail 等多種應用,並相容 OpenAI、Anthropic、DeepSeek 以及 Ollama 本地模型,開源一週即破萬 Star。
- 傳送門:GitHub 儲存庫
M3 / MSA 稀疏注意力推論核心開源 — MiniMax & Fireworks AI
- 內容簡介:MiniMax 與 Fireworks AI 聯合開源了 M3 模型底層的 MiniMax Sparse Attention (MSA) 核心程式碼。透過最佳化載入與儲存管線,成功將推論吞吐量提升 1.6 倍,進一步推進開源高效推論生態。
- 傳送門:GitHub 儲存庫
Google Flow Music 導入 Lyria 3.5 模型
音樂創作有了新突破。Google 將音樂生成模型 Lyria 3.5 整合至 Google Flow Music 官方平台。官方表示,升級後的模型在旋律結構、歌詞生成與人聲表現上皆有所提升。系統現在能精準遵循提示詞,生成具備情緒起伏的人聲與歌詞,同時讓使用者彈性調整輸出的節奏與長度。
SpaceXAI 發表 Grok Voice Think Fast 2.0 語音模型
語音互動領域迎來新世代產品。SpaceXAI 旗下新一代語音對語音(speech-to-speech)模型 Grok Voice Think Fast 2.0 正式亮相。根據 SpaceXAI 發布的最新消息,該模型導入邊說邊推理的平行處理機制。官方測試顯示首個音訊延遲約為 0.7 秒,在噪音環境與電話音質下的轉錄準確度亦有顯著提升。在對話動態設定上,代理程式傾向使用較短語句回答,計費則採每分鐘音訊 0.08 美元。
OpenAI GPT-5.6 提升推論與運算效率
推論效率與運算資源的平衡有了新解方。GPT-5.6 系列模型 帶來了旗艦版 Sol、平衡版 Terra 與輕量版 Luna。官方指出,這系列模型運用負載平衡機制(依地理位置與硬體分配工作)以及推測解碼(Speculative decoding)技術,讓詞彙生成效率提升超過 15%。其中,GPT-5.6 Sol 甚至參與重寫了數學運算專用的 GPU 核心程式碼,搭配提示快取(prompt caching)技術,有效降低了代理框架的重複運算。
ChatGPT 針對學術研究人員推出專屬免費計畫
為協助學術界取得先進研究資源,ChatGPT 學術研究人員計畫 已經啟動,預計於 2027 年前提供 10 萬名學者免費使用 GPT-5.6 Sol Pro。該計畫初期已對高等研究院(IAS)與巴黎高等師範學院(ENS)等機構的 1 萬名研究員開放,支援邀請最多四位同機構夥伴協作。平台內建 75 種生命科學專屬技能,並提供企業級隱私保護,預設不將用戶數據用於模型訓練。
Replit Design 推出介面設計套件
介面設計工具 Replit Design 試圖將環境智能融入開發流程。這套工具內建 Mobbin 資料庫,提供來自上千個應用程式、超過六十萬個真實螢幕畫面的範本。系統能在設計過程中給予即時建議與變體選擇,幫助使用者在單一平台上走完設計與建置流程,避免工具切換造成的細節偏差。
Perplexity 開源 Numbat 以強化 AI 代理程式安全
隨著 AI 代理程式執行更複雜的任務,資安防護的需求也隨之提升。Perplexity 將其客戶端端點安全套件 Numbat 開源,用以防範 Agent 在執行任務時越權或引發安全風險。這款輕量級靜態 Go 二進位檔可無縫嵌入主流代理框架,透過鉤子(Hooks)、會話工件與 OTLP 遙測技術提供即時監控與攔截,目前支援 macOS、Linux 與 Windows 系統。
Looker 代理工作流自動化數據監控與根本原因分析
數據監控變得更加直覺自動。Looker 代理工作流(Agentic Workflows) 預覽版讓使用者能以自然語言提示詞(例如「每週監控退貨率」)建立監控程序。一旦指標觸發指定閾值,系統會自動針對底層數據模型執行關鍵驅動因素分析(KDA),接著將診斷摘要推播至 Slack 或電子郵件。
OpenAI 透過設定調整提升 ARC-AGI-3 測試表現
評估 2D 益智遊戲推理能力的 ARC-AGI-3 平台上,GPT-5.6 Sol 最初得分僅 13.3%。OpenAI 團隊事後分析發現,原測試框架會在每次動作後丟棄私有推理過程,同時滾動截斷機制也會導致模型遺忘早期動作歷史。開發團隊在 Responses API 中啟用「保留推理(Retain reasoning)」與「壓縮(Compaction)」兩項設定後,模型得以保留歷史思考計畫,測試分數隨即提升至 38.3%,輸出的詞彙數量也獲得縮減。
Hermes 代理程式加入全設備喚醒詞功能
語音助理的觸發方式更貼近日常習慣。Hermes 代理程式新增「喚醒詞(Wake Word)」功能,允許使用者透過 “Hey Hermes” 指令在 CLI、TUI 與桌面應用程式中啟動對話。根據 Hermes 官方說明文件 指出,該偵測主要於設備端本地運行,僅在觸發後才會傳輸音訊。系統預設使用支援本地 ONNX 模型的 openWakeWord 引擎,並相容不需預先訓練的 Sherpa 開放詞彙模型。
macOS 版 Gemini 應用程式新增語音控制功能
桌面端的工作流程與 AI 整合再進化。macOS 版 Gemini 應用程式新增了自然語言語音控制功能,使用者長按 Fn 鍵便可啟動聽寫,系統會自動過濾語助詞並修正句構。在啟用推理功能的情況下,Gemini 可直接讀取螢幕上的文字或文件進行摘要、語氣重寫,甚至能調整插圖樣式(如切換為深色模式)。詳細操作指南可參閱 Gemini 語音新功能介紹。
問與答(Q&A)
Q1:什麼是 Perplexity 開源的 Numbat 套件?它是如何保護 AI 代理程式安全的?
A1: 隨著現在的 AI Agent(例如 Claude Code 或 Codex)自主權越來越高,如果它們遇到找不到檔案或權限不足等環境錯誤,有時會為了解決問題而失控,造成越權刪除資料或外洩敏感數據等「意外崩潰」。為了解決這個風險,Perplexity 開源了這款名為 Numbat 的安全套件。作為一個輕量級的 Go 語言二進位檔,它可以直接嵌入主流的客戶端框架中。它的防護邏輯集中在三個面向:首先是透過「預先動作鉤子」在危險動作發生前進行攔截;其次是收集硬碟的原始會話紀錄,供資安團隊事後鑑識重建;最後則是接收本地端的 OTLP 遙測數據,讓團隊能集中審查 Agent 的活動軌跡。
Q2:OpenAI 的 GPT-5.6 Sol 模型在 ARC-AGI-3 測試中,如何透過 Responses API 提升分數?
A2: GPT-5.6 Sol 最初在 ARC-AGI-3 公開測試集上的得分僅 13.3%。OpenAI 團隊分析指出,這主要歸咎於原測試框架的兩項限制。首先,系統會在每次遊戲動作後丟棄私有推理過程,使模型無法延續先前的思考計畫;其次,對話超長時的滾動截斷機制會讓模型遺忘早期歷史。為了解決這些限制,OpenAI 改用 Responses API 部署測試並啟用了兩項設定。他們透過「保留推理」機制傳遞前次回應 ID,維護連貫策略,並利用「壓縮」功能取代傳統截斷以保留學習規則。團隊測試顯示,這兩項調整讓分數提升至 38.3%,並因減少重複思考,使輸出 Token 量降低了 6 倍。
Q3:SpaceXAI 推出的 Grok Voice Think Fast 2.0 具備哪些核心技術特點?定價如何?
A3: Grok Voice Think Fast 2.0 是 SpaceXAI 推出的新一代語音對語音模型,最大特點在於具備「邊說邊思考」的能力。它能在輸出語音的同時平行處理推理任務,讓工具調用通常在說完第一句話前即可完成。官方測試顯示其首次音訊生成時間約為 0.70 秒。在準確度方面,根據官方數據,它在 24 種語言測試中的字錯誤率比競品降低 1.5 至 2.0 倍,在吵雜或電話壓縮環境下,精準度更可達專用模型的約 10 倍。另外,透過大規模強化學習,模型現在傾向用較短語句且一次只問一個問題來避免對話冗長。計費方式則採每分鐘音訊 0.08 美元的固定費率。
Q4:OpenAI 推出的「ChatGPT 學術研究人員計畫」能提供哪些具體資源?
A4: 這項計畫預計於 2027 年前提供 10 萬名符合資格的大學研究人員免費使用進階 AI 模型。參與者可以存取 GPT-5.6 模型家族(包含 Sol、Terra 與 Luna),並使用具備深度研究功能的代理工具及更廣的上下文窗口。針對專業領域,環境內建了涵蓋基因體分析、蛋白質建模與藥物開發等超過 75 種生命科學技能,還提供連結外部臨床數據庫的專屬連接器。在協作與資安方面,通過審核的學者可邀請最多 4 名同機構夥伴加入,工作空間皆具備企業級保護,且預設不會將用戶資料用於模型訓練。



