AI 日報|智譜 GLM-5.3 正式發布、OpenAI 推出零資料留存與私有安全處理、Anthropic 展示 AI 自主蛋白質 De Novo 設計
模型發布/更新
GLM-5.3 — 智譜 AI (Zhipu AI)
- 一言以蔽之:智譜正式發布 GLM-5.3 API,後訓練使程式碼能力提升 50%,綜合指標並列開源第一且維持原價。
- 核心亮點:
- 後訓練強化學習突破:在與 GLM-5.2 相同底座(743B MoE)下,透過長週期強化學習(RL)使程式碼能力大幅提升 50%。
- AA 綜合指數開源第一:在 Artificial Analysis 綜合指數中取得 60 分,與 Claude Fable 5、GPT-5.6 Sol 處於同一第一梯隊。
- 高價效比優勢:單任務推理成本為同級旗艦模型中最低,權重預計於下週五正式開源。
- 技術規格:約 743B MoE 引數(單次啟用 40B) / 閉源 API(下週開源) / 支援長程推理與複雜 Coding
- 傳送門:智譜官方技術部落格
Eleven v3 Conversational — ElevenLabs
- 一言以蔽之:ElevenLabs 正式全面開放 Eleven v3 Conversational 超即時情感語音模型。
- 核心亮點:
- 精細情感控制:支援音訊標籤(Audio Tags),開發者可在文字中即時插入情感與語氣控制。
- 高並發對話支援:推出 Multi-context WebSockets 介面,支援單一連線同時管理多路語音對話。
- 技術規格:閉源 API / 支援 70+ 語言 / 價格自 $0.05 / 1k 字元起
- 傳送門:
Eleven v3 Conversational, our most expressive model for realtime speech, is now generally available.
— ElevenLabs (@ElevenLabs) August 19, 2026
For developers building voice experiences that respond with real emotion, Eleven v3 Conversational includes audio tags for fine-grained control and support across 70+ languages. pic.twitter.com/TOAkZt3qGa
產品發布/更新
Vercel Agent for Slack — Vercel
- 更新內容:將 Vercel Agent 直接整合至 Slack 頻道與討論串。團隊成員可在討論中 Tag
@Vercel,AI Agent 會自動結合部署紀錄、日誌與資料指標分析問題,並在獲得授權後自動建立 PR 或執行部署回滾。 - 適用人群:全棧工程師 / DevOps / 軟體開發團隊
- 體驗通道:Vercel 官方部落格
Send a SAFE — Y Combinator
- 更新內容:Y Combinator 推出免費工具 Send a SAFE,專門讓創辦人及其 AI Agent 能在 2 分鐘內自動生成、簽署並傳送 SAFE(未來股權簡單協議)新創融資協議。
- 適用人群:新創團隊創辦人 / AI Agent 自動化工作流開發者
- 體驗通道:
Replit Free Mode (GPT-5.6 Luna) — Replit & OpenAI
- 更新內容:Replit 推出由 OpenAI GPT-5.6 Luna 驅動的 Free Mode 免費模式,讓開發者與一般使用者無須負擔 Token 費用,即可透過自然語言交談直接構建與部署完整 Web 應用。
- 適用人群:Web 開發者 / 獨立創作者 / 程式寫作初學者
- 體驗通道:OpenAI 官方新聞稿
Gemini Live 深度研究與全球大學生免費方案 — Google
- 更新內容:Google 推出 Gemini Live 語音啟動 Deep Research(深度研究)功能,並正式向全球 140 多個國家的大學生開放免費領取為期一年的 Google AI 訂閱計劃。
- 適用人群:全球大學生 / 知識工作者 / 學術研究人員
- 體驗通道:Google 官方部落格
Rider AI Agent 專屬重構引擎技能 — JetBrains
- 更新內容:JetBrains Rider 2026.2.1 內建全新的
refactoring-codeSkill,讓 AI Agent 能直接呼叫 Rider 原生的 C# 重構引擎,使重構任務處理速度提升 83%、成本降低 64%。 - 適用人群:C# / .NET 開發者 / AI Coding Agent 使用者
- 體驗通道:JetBrains .NET 部落格
Gemini 整合至 Waymo 自訂車款 Ojai — Waymo & Google
- 更新內容:Waymo 將 Google Gemini 模型整合至其最新自製無人駕駛車款 Ojai 中,為乘客提供具備上下文理解與個人化對話能力的 AI 乘客助理。
- 適用人群:無人駕駛乘車體驗者 / 自動駕駛生態關注者
- 體驗通道:Google 官方部落格
產業動態
OpenAI 正式推出「零資料留存 (ZDR)」與 Private Safety Processing
- 事件概述:OpenAI 宣佈為前沿模型全面提供零資料留存(Zero Data Retention, ZDR)選項,並預覽 Private Safety Processing 技術。該技術可在客戶端加密基礎設施上自動監控跨會話的安全風險,無須由人工審查或保留提示詞資料。
- 影響分析:此舉直接反擊 Anthropic 近期要求保留特定模型資料 30 天的政策,大幅提升了金融、醫療等高度合規需求企業匯入 AI 的隱私防護力。
- 新聞連結:OpenAI 官方新聞稿
NVIDIA 開源 SkillEvaluator 技能評測工具
- 事件概述:NVIDIA 評測了超過 300 個驗證過的 AI Agent 技能(Skills),資料顯示具備高質感技能的 Agent 在任務正確性上可提升 41 分,並同步將其評測工具 SkillEvaluator 完全開源。
- 影響分析:建立標準化的 AI Agent 技能評測規範,有助於開發者在部署前客觀量化 Skill 對 Agent 的實質效能提升。
- 新聞連結:
We benchmarked 300+ NVIDIA verified skills to see how much they actually help agents on real tasks.
— NVIDIA AI (@NVIDIAAI) August 19, 2026
Same task, same model, same setup. The only difference was whether the agent had the skill.
Across the benchmarks, skills improved correctness by 41 points, effectiveness by 39,… pic.twitter.com/gsG5OSYOLN
論文研究
Claude 實現蛋白質 De Novo 設計突破 — Anthropic
- 研究動機:驗證前沿 LLM / AI Agent 是否能從零開始(de novo)自主完成高難度的生物大分子與蛋白質設計。
- 核心創新:由人類專家提供高階提示詞,讓 Claude 自主協調並呼叫多個開源蛋白質設計模型(如 RFdiffusion、Genie 等),並與 Adaptyv Bio 和 Twist Bioscience 合作進行實體濕實驗(Wet-lab)驗證。
- 研究成果:Claude 自主為 15 個目標靶點中的 14 個成功設計出全新蛋白結合物,實驗命中率達 22–35%(傳統基準線僅 10–15%)。
- 論文地址:Anthropic 官方研究報告
人工智慧時代的數學 (Mathematics in the Age of AI) — Terence Tao (陶哲軒)
- 研究動機:回應具備研究級能力之 AI 工具對數學界產生的衝擊,並重新審視數學研究的本質目標與價值規範。
- 核心創新:將 AI 時代的數學探索比作 20 世紀初的數學基礎危機,主張將隱性數學實踐(如問題求解、價值判定)顯性化與規範化。
- 研究成果:發表於 ICM 2026 的專題論述,為數學界與 AI 研究社群如何負責任地利用研究級 AI 工具提供了指引框架。
- 論文地址:ArXiv 論文頁面
DeepSeek-V4-Pro 於 H20 GPU 上的極限服務最佳化 — LMSYS Research
- 研究動機:探索如何在成本較低的 H20 GPU 上高效部署高達 1.6 萬億(1.6T)引數的 MoE 模型 DeepSeek-V4-Pro。
- 核心創新:設計場景化服務配置(Scenario-based Serving Configurations),透過最佳化 KVCache DRAM 池化與跨節點網路排程,逼近高階 B300 晶片的推論效能。
- 研究成果:單節點 H20 達到 271 output tokens/s,將與 B300 (383.7 tokens/s) 的效能差距縮小至 1.42 倍。
- 論文地址:LMSYS 官方部落格
其他分享
TrueForge 開源 AI Agent Harness 架構 — TrueFoundry
- 內容簡介:TrueFoundry 開源 Vendor-Neutral 的 AI Agent 工具鏈 TrueForge。可支援 OpenAI、Anthropic、GLM 及 DeepSeek 等多模型路由,並大幅降低開源模型(如 GLM-5.2)執行成本達 75%。
- 傳送門:
New open-source agent harness just landed!
— elvis (@omarsar0) August 19, 2026
I got early access to TrueForge by TrueFoundry and have been running it locally for the past few days.
The harness layer deserves as much attention as the model, and open source matters here because you can inspect the loop, run it on… pic.twitter.com/pIShaqUb3F
Agent Arena Pareto Frontier 排行榜 — Arena.ai
- 內容簡介:Arena.ai 上線 Agent Arena 帕累託前沿(Pareto Frontier)排行榜,綜合評估模型在真實世界長流程 Agent 任務中的效能與單次任務中位數成本(Median Task Cost)。
- 傳送門:
Pareto frontier is live in Agent Arena! Dive into model performance on real-world agentic tasks, compared to the median cost per task.
— Arena.ai (@arena) August 19, 2026
The current models on the Pareto frontier for Agent Arena are:
- Claude Opus 5 (High) by @AnthropicAI (+12.34%/ $1.78)
- Kimi K3 (Max) by… https://t.co/S5fgOm7rxu pic.twitter.com/eeSy0UV9wM



