AI日報|ChatGPT桌面端語音開放,FLUX 3同步生成影音,微軟發表MAI雙模型
今日重點
- 語音助理大升級:OpenAI 把語音控制搬上桌面,Claude 則開始陪你用語音拆解複雜難題。
- FLUX 3 多模態震撼登場:BFL 採用單一架構,同步生成高解析度影片、影像與原生音訊,打破影音生成極限。
- 微軟發布 MAI 雙模型:MAI Image-2.5-Pro 終於搞定圖片裡的文字渲染,還能直接用白話文修圖。
- 小模型發威:Ling-3.0-flash 與 KAT-Coder-V2.5-Dev 靠著混合專家(MoE)架構榨出驚人效能。
- 工作流升級:Runway 推出幫你挑模型的「媒體路由器」,OpenAI Codex 終於支援跨資料夾協作。
- 底層技術突破:PaddlePaddle 實現階層式平行文件解析,LLaDA2.2-flash 讓語言模型也能邊生成邊「修改」。
技術名詞速覽
- MoE(混合專家架構): 系統把模型拆成多個「專家」,每次生成只喚醒需要的少數參數,省算力又保證品質。
- 階層式平行解碼(Hierarchical Parallel Decoding): 不再像以前那樣一個字一個字慢慢吐。主分支管全局排版,其他分支同時處理局部內容,解析長文件的速度直接翻倍。
- 萊文斯坦編輯(Levenshtein Editing): 擴散語言模型的新機制。白話來說,模型在平行輸出的過程中,可以直接「插入」或「刪除」字元來抓蟲修正。
重大新聞
1. 語音控制與個人健康數據的無縫結合
用嘴巴寫程式、控制電腦,聽起來有點像早期的科幻片,但 OpenAI 剛把它搬進了 macOS 和 Windows 的桌面版。靠著 GPT-Live 的即時能力,你現在可以直接開口指揮背景的 Codex 幫忙處理專案。
ChatGPT Voice is now in the desktop app.
— OpenAI (@OpenAI) July 23, 2026
Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice.
It's powered by GPT-Live, so it can speak, listen, and coordinate work in the app at the same time.
Rolling out globally today… pic.twitter.com/ODZWKqecCf
Codex 還有個很實用的更新:終於支援跨資料夾讀取程式碼和技術文件了。只要都在同一個 Git 根目錄下就行,不用再為了讓 AI 讀懂專案而把檔案搬來搬去。
Keep work across multiple folders in one Codex project.
— OpenAI Developers (@OpenAIDevs) July 23, 2026
Local projects can now include related code, docs, and reference files from multiple folders. Codex can read and write across them while one primary folder remains the Git root. pic.twitter.com/QXHqRhM74f
離開工作場景,ChatGPT 針對美國市場推出了 健康資訊整合功能。只要你願意授權,它能直接讀取 Apple Health 的數據來解讀那些像天書一樣的體檢報告。至於隱私,OpenAI 承諾這些健康數據不會被餵給基礎模型當訓練材料。
2. BFL 推出 FLUX 3,單一架構同步生成高解析度影音
BFL 最新發布的 FLUX 3 在多模態領域投下震撼彈。不同於過去將各模態分開訓練再拼湊的做法,FLUX 3 採用單一且統一的架構,能夠同步學習並生成高解析度影片、影像與原生音訊。這不僅解決了各模態獨立學習的限制,更支援長達 20 秒的影音生成,帶來極高真實感的視覺與聽覺體驗。
3. 微軟 MAI 模型再進化,文字渲染精準度大躍進
微軟在 最新發表會 亮相的 MAI Image-2.5-Pro 解決了一個長久以來的痛點:圖片裡的文字渲染。以前用 AI 生成帶有招牌或標語的圖片,文字經常糊成一團,但 2.5-Pro 的拼寫準確度有著肉眼可見的提升。
另一個亮點是,你可以直接用大白話叫它修改圖片細節。微軟這次還搭著 GB200 運算叢集和 MAI-Voice-2-Flash 一起登場,在生成式媒體這塊的企圖心相當明顯。
模型與架構更新
4. 混合專家架構展現極致效率:Ling-3.0-flash 與 KAT-Coder 登場
AI 圈最近似乎不再盲目追求「參數越大越好」。inclusionAI(在社群平台 X 的帳號為 AntLingAGI)推出的 Ling-3.0-flash 是個好例子:總參數 124B,但在生成每個 token 時,實際啟動的只有 5.1B。這點運算量,在不少 benchmark 上卻能和 1T 參數的巨獸打平甚至超車。有興趣的人可以去 OpenRouter 跑跑看。
Today, we’re releasing Ling-3.0-flash—a hybrid-reasoning MoE model built for production-scale agents.
— Ant Ling (@AntLingAGI) July 23, 2026
124B parameters. Just 5.1B active per token.
With 1/8 of the total and 1/12 of the active parameters, it matches or beats our 1T flagship model on most benchmarks shown. pic.twitter.com/QdPVd2f6pw
Kwaipilot 新開源的 KAT-Coder-V2.5-Dev 同樣走了 MoE 路線。他們把心力花在監督式微調和強化學習上,針對性地壓制了 AI 寫扣時最惱人的「單輪無限鬼打牆」問題,讓輸出的程式碼更穩定。
工具與生產力
5. 語音處理複雜難題,生成媒體也有了專屬「路由器」
有時候卡關,用語音跟人對話釐清思路比打字有效。Anthropic 把這個概念放進了 新的 Claude 語音模式,主打陪你把半成形的想法盤清楚。滿特別的是,你跟它講話講到一半,它可以直接在背景去抓你綁定的 Google Calendar 或 Gmail 等工具,並且支援多語系切換。
Voice mode now runs on Claude's more capable models and reaches the tools you've connected mid-conversation.
— Claude (@claudeai) July 23, 2026
Talk through the hard problems out loud, in many more languages. pic.twitter.com/k0CWAGjLdK
在媒體生成這邊,Runway 搞出了一個 Media Router。面對每天都在翻新的生圖、生影片模型,開發團隊很難天天去測哪個最好用。現在只要預設好成本、延遲和品質的底線,Router 就會自動把任務丟給當下最適合的模型。
另外,Google 的個人代理 Gemini Spark 開始向美國的 AI Pro 訂閱戶推送了,定位是 24 小時在背景幫你打理瑣事的數位助手。
Gemini Spark is now also starting to roll out to Google AI Pro subscribers in the U.S., and we'll be bringing it to AI Pro subscribers in more countries soon.
— Google Gemini (@GeminiApp) July 23, 2026
More info on where Gemini Spark is available here: https://t.co/HUF0DN8aVt https://t.co/g2zaLhufWc
研究與前沿探索
6. 突破傳統框架的解碼與擴散技術
AI 讀取長篇文件的結構排版一直很慢。PaddlePaddle 在 Hugging Face 上的 HPD-Parsing 給出了一個很暴力的解法:不逐字生成了。這個 1B 參數的模型用「階層式平行解碼」,主分支釘死全局排版,底下的子分支同時去拆解不同區塊,把吞吐量直接拉到 4,752 TPS。
另一個引起我注意的是同樣來自 inclusionAI 的 LLaDA2.2-flash。作為一個擴散語言模型,它加入了萊文斯坦編輯機制,也就是說它可以在平行輸出的過程中隨時「插入」或「刪除」字元來修錯,這跟我們習慣的自回歸模型很不一樣。
觀察與觀點
把這幾天的消息攤開來看,有兩件事滿明顯的。
第一,語音不再只是我們開車或雙手沒空時的替代方案。當 ChatGPT 和 Claude 把語音深植進桌面和複雜的思考流程裡,用語音去「盤邏輯」或「下指令寫扣」正在變成工作常態。
第二,硬拚算力的時代可能見頂了,或者說,大家終於學會精打細算。不管是 Ling-3.0-flash 把活躍參數壓到 5.1B,還是 HPD-Parsing 用平行解碼去繞過傳統架構的極限,我們看到更多聰明的工程手段,而不是單純疊加 GPU。這其實是件好事,當模型不再那麼「重」,我們才有機會看到這些工具真正普及到每一個背景執行緒裡。
問與答(Q&A)
問:ChatGPT桌面版語音功能有什麼亮點? 答:桌面版語音功能由GPT-Live驅動,使用者可以透過語音直接討論想法與協調任務,跨應用程式協調多個代理程式與Codex進行工作。此外,在macOS上還能開啟螢幕上下文功能,讓ChatGPT看見使用者目前的視窗內容並進行互動。
問:BFL發布的FLUX 3模型最大的特色是什麼? 答:FLUX 3採用統一架構,能夠同時學習並同步生成高解析度影片、影像與原生音訊。它不僅解決了各模態獨立學習的限制,還能提供極高真實感的視覺與聽覺體驗,並支援長達20秒的影音生成。
問:微軟MAI Image-2.5-Pro解決了生成式AI的哪些痛點? 答:MAI Image-2.5-Pro大幅提升了圖片中的文字渲染準確度,解決過去文字容易出錯的問題。同時它支援透過自然語言指令進行直覺的局部圖像修圖,讓創作者的迭代過程更快速且直覺。
問:什麼是混合專家架構模型?這次有哪些相關發表? 答:混合專家架構可以讓模型在生成時僅啟動少數需要的參數,大幅節省算力並維持高效能。本次包含inclusionAI發表的Ling-3.0-flash,總參數124B但每次僅啟動5.1B參數;以及Kwaipilot開源的KAT-Coder-V2.5-Dev程式碼生成模型,總參數35B但僅啟動3B參數。
問:針對長篇文件的解析,PaddlePaddle提出了什麼解決方案? 答:PaddlePaddle推出了僅1B參數的HPD-Parsing模型。該模型採用階層式平行解碼技術,由主分支負責全局排版,並動態分配子分支同時處理局部內容生成,一舉打破了傳統循序生成的延遲瓶頸,將吞吐量提升至4752 TPS。
問:ChatGPT新推出的健康資訊整合功能如何保障用戶隱私? 答:ChatGPT針對美國用戶開放連結Apple Health及電子病歷等醫療數據。OpenAI強調,這些連結的健康數據與相關對話皆不會被用於訓練基礎模型或投放廣告,用戶也可以隨時取消連結並刪除資料。



