AI日报|GLM-5.3登顶开源榜首,OpenAI因安全风险暂停前沿RL训练,Mojo正式全量开源
模型发布/更新
GLM-5.3 — 智谱 (Z.ai)
- 一言以蔽之:智谱正式发布 GLM-5.3 API,在 Artificial Analysis 智能指数上斩获 60 分追平 Kimi K3,登顶最强开源权重模型。
- 核心亮点:
- 保持 753B 总参数 / 40B 激活的 MoE 架构与 1M 上下文窗口,能力跃升完全归功于强化学习与后训练(Terminal-Bench 3.0 从 4.6 跃升至 28.3,DeepSWE v1.1 升至 66.9)。
- 专为长周期复杂代码工程、防御性网络安全和智能体协同任务优化,API 定价维持与 5.2 版本持平。
- 技术规格:753B MoE (40B 激活) / 权重开源(MIT 许可,一周内开放)/ 1M Context Window
- 传送门:智谱官方 API 指南
MAI-Image-2.6 Preview — 微软 (Microsoft AI)
- 一言以蔽之:微软推出新一代图像编辑模型 MAI-Image-2.6,在 Image Arena 单图编辑榜登上全球第三。
- 核心亮点:
- 在 Image Edit 竞技场拿下 1420 分,击败 Google Nano Banana 及 Meta Muse Image,相比 2.5 版本提升 19 分。
- 在 3D 渲染、商品商业设计、玄幻插画以及文本渲染(+43 分)等维度展现出显著进步。
- 技术规格:多模态图像生成与编辑大模型 / 闭源 (Microsoft Foundry 私有预览)
- 传送门:
We hit No.3 on the Image-editing benchmark! ... beating Google’s Nano Banana and Meta’s Muse Image models. https://t.co/Mm5ImJKvho
— Mustafa Suleyman (@mustafasuleyman) August 18, 2026
Pika Soundtrack — Pika Labs
- 一言以蔽之:Pika 推出生成式音频大模型 Pika Soundtrack,实现高质量画面与音效/配乐/配音的自适应极速对齐。
- 核心亮点:
- 将视频压缩为潜变量 Token,由 Latent Diffusion Transformer 跨注意力协同生成去噪音频,画面动作与声音同步精准度(DeSync 0.5537)登顶评测榜。
- 支持动作感知音效、自适应配乐和人声生成,API 调用价格相比行业竞品降低达 50% 至 90%。
- 技术规格:Video-to-Audio 多模态生成模型 / 专有 API
- 传送门:
A technical peek under the hood of our Pika Soundtrack model.
— Pika (@pika_labs) August 18, 2026
It excels in video-to-audio alignment, the most crucial factor in perceived quality. Across a 67-chunk benchmark, Pika Soundtrack ranked first for semantic alignment and audiovisual synchronization:
ImageBind: 0.2457… pic.twitter.com/t77Jy4wv8K
产品发布/更新
ChatGPT for Teens — OpenAI
- 更新内容:OpenAI 推出专为 13-17 岁青少年设计的 ChatGPT for Teens,默认开启高强度安全防护与家长控制功能。内置“学习模式”(Study Mode),在回答作业时主动引导分步推导而非直接提供最终答案;支持设定“学习时间”(Study Hours)控制使用时长,并与 CodeAI 合作提升全球青少年的 AI 素养。
- 适用人群:[中学生 / 家长 / 教育从业者]
- 体验通道:OpenAI 官方公告
Claude Gmail & Google Drive 深度连接器 — Anthropic
- 更新内容:Anthropic 为 Claude 网页端及移动端上线全新的 Google Connector,支持直接在对话界面发送与回复 Gmail 邮件,以及管理 Google Drive 内部文件。系统提供严密的权限把控,用户可设置邮件发送前必须经由人工二次确认。
- 适用人群:[办公一族 / Claude 付费用户 / 效率极客]
- 体验通道:
Claude can now send emails in Gmail and manage files in Google Drive.
— Claude (@claudeai) August 18, 2026
Ask Claude to reply to a thread, and it drafts and sends the response. You control when it needs your approval.
Connect Gmail or Google Drive from the connectors menu to try. Available on all paid plans. pic.twitter.com/cFZEjh3MgB
fx 轻量级原生编码智能体 — Vercel Labs
- 更新内容:Vercel Labs 开源基于 Zig 语言打造的极简 AI 编码 Harness 与 CLI 工具
fx。单文件二进制体积仅 6.3MB,冷启动时间低至 10 微秒,内存占用维持在个位数 MB。fx专为模型基准测试、无缝嵌入终端和高性能极速开发设计,完全模型无关(Model-agnostic)且支持 MCP 协议。 - 适用人群:[全栈开发者 / 命令行极客 / 智能体架构师]
- 体验通道:
I’ve been using https://t.co/3Z4NESzNKd as my daily driver and it’s a one-way street.
— Guillermo Rauch (@rauchg) August 18, 2026
It’s 10-20x smaller than the major coding CLIs. It starts up instantaneously. It feels more like using 𝚣𝚜𝚑 than an IDE in your terminal. It’s embeddable anywhere, even your browser via… https://t.co/VungKVzRlR
TensorRT Model Connect (TRTMC) — NVIDIA
- 更新内容:NVIDIA 发布 TensorRT Model Connect 公开预览版,允许开发者使用仅两条命令将 Hugging Face 或本地检查点直接转化为端到端 TensorRT 推理,完全抛弃了繁琐且易出错的中间 ONNX 导出过程,并可原生通过 C++ API 高效调用。值得一提的是,该项目整个代码库、性能调优和文档均由 OpenAI Codex 智能体协同开发完成。
- 适用人群:[AI 部署工程师 / C++ 开发者 / 性能调优专家]
- 体验通道:GitHub - NVIDIA/TensorRT-Model-Connect
LangSmith Tuned Evaluators — LangChain
- 更新内容:LangChain 推出生产环境智能体评估组件 LangSmith Tuned Evaluators。首发“感知错误”(Perceived Error)评估模型,可自动对线上真实 Trace 进行打分并捕捉潜在的不当表现。专有微调小模型在评估准确度上超越了主流旗舰大模型,同时将评估成本大幅降低了 82%。
- 适用人群:[智能体运维团队 / LLMOps 工程师 / AI 产品经理]
- 体验通道:
Introducing LangSmith Tuned Evaluators
— LangChain (@LangChain) August 18, 2026
They automatically score agent behavior in production, starting with Perceived Error.
Perceived Error is one of the clearest signals that your agent is giving users a helpful experience.
In our benchmark, our specialized model…
Claude Code 使用额度 50% 额外赠送延长至 8 月底 — Anthropic
- 更新内容:Anthropic 官方宣布,将每周为 Claude Code 订阅用户提供的 50% 额外使用额度福利再次延长至 8 月 31 日。官方表示正努力将该提升转化为常态化套餐规则,但由于全球用户对 Claude Code 的强劲算力需求,短期内计算资源可能保持紧俏。
- 适用人群:[Claude Code 付费用户 / AI 程序员]
- 体验通道:
Anthropic 感觉就总是给人很纠结很不爽利的那种感觉!这提升 50% 额度明明挺好的事,停了又怕你不满意,彻底放开又舍不得,就一次又一次的延期,还不如索性一直提升 50% 得了。
— 宝玉 (@dotey) August 18, 2026
就跟当年 Fable 5 一样,一会说只有 2 周,一会又延期,最终还是放开了,但这个过程就给人感觉挺不好! https://t.co/a57voHzzDK
行业动态
OpenAI 暂停部分前沿 RL 训练两周,安全与对齐决定 AI 演进节奏
- 事件概述:OpenAI 官方宣布,由于即将推出的 Astra 模型在网络安全测试中表现出的能力达到了危险级别,决定主动暂停最新部署模型的强化学习(RL)训练两周,并暂缓最大规模的前沿 RL 训练。在此期间,团队对研究环境进行网络隔离、红队演练,并扩展思维链(CoT)监控覆盖率。创始人 Sam Altman 表示,安全和对齐信心将日益决定 AI 开发的步调。
- 影响分析:这是顶级 AI 实验室首次因模型能力“增长过快”超出安全监控范围而单方面按下前沿训练暂停键。这标志着大模型竞争正从纯粹堆叠算力 scaling,转向“安全与可控性决定能力上限”的新阶段。
- 新闻链接:OpenAI 官方安全与对齐声明
Mojo 编程语言宣告完全开源,编译器与工具链拥抱 Apache 2.0
- 事件概述:Modular 官方宣布,专为 AI 与 GPU 编程打造的 Mojo🔥 语言在发布 1.0 稳定版后,正式将其编译器、工具链及全套源码以 Apache 2.0 许可证(含 LLVM 例外)开源在 GitHub。Mojo 放弃了此前要做 Python 100% 超集的路线,转而作为独立的高性能语言,旨在用类 Python 语法大幅降低 GPU 硬件编程的门槛。
- 影响分析:Mojo 的完全开源消除了此前开发者对商业闭源锁定的担忧,将极大地推动异构计算与 AI 底层算力编程生态的繁荣,并为 PyTorch 等上层框架提供更轻量高效的底层替代方案。
- 新闻链接:Modular 官方博客
Vercel 设立 100 万美元黑客悬赏基金,公开测试 Vercel Sandbox 边界
- 事件概述:Vercel 宣布设立 100 万美元的公开黑客挑战基金,邀请全球安全研究者与 AI 智能体来尝试攻破 Vercel Sandbox。随着 AI 智能体拥有执行任意未信任代码的能力,传统的微 VM(如 Firecracker)隔离已无法完全防范网络路径越权。Vercel 旨在通过公开对抗验证其宿主机网络边界安全性,每份有效漏洞报告最高可得 50,000 美元。
- 影响分析:在智能体大行其道的时代,代码沙箱的安全性上升为 AI 基础设施的核心命脉。Vercel 这一举措为业界建立了“智能体安全沙箱”的透明验证标杆。
- 新闻链接:Vercel 官方博客
JetBrains 2026 报告:90% 开发者已每周使用 AI 编码智能体
- 事件概述:JetBrains 发布《2026 年开发者生态调查报告》,对全球 15,000 多名专业开发者进行了调研。数据表明,AI 编码智能体(Coding Agents)已彻底成为主流:90% 的专业程序员在每周工作中至少使用一次 AI 智能体,其中高达 68% 的开发者选择每天使用。此外,Claude Code 在开发者群体中的采纳速度与增长率占据行业领先地位。
- 影响分析:AI 辅助编程已从早期探索阶段进入全面普及期,以 Claude Code、Cursor 为代表的智能体正深度重构软件工程全生命周期。
- 新闻链接:JetBrains Research 调研报告
论文研究
Claude 自主完成从头蛋白质结合剂设计全流程 — Anthropic
- 研究动机:传统 de novo 蛋白质设计高度依赖领域专家进行繁琐的人工参数调优与干预,研究团队旨在探索大语言模型能否自主端到端完成复杂的生命科学计算实验。
- 核心创新:Anthropic 在专家提示词框架下,让 Claude(Mythos Preview 与 Opus 4.8)自主完成 15 个靶点的蛋白质结合剂计算设计。随后由第三方实验室(Adaptyv Bio 与 Twist Bioscience)合成并进行湿实验验证。
- 研究成果:Claude 在 15 个靶点中的 14 个成功设计出结合剂;独立实验检测的 1320 个设计中有 354 个成功结合,命中率高达 22.6%-35.1%(传统人工流程仅 10%-15%),且顶级设计的结合紧密度比已知 de novo 结合剂高出数倍。
- 论文地址:Anthropic 官方研究报告与数据集
Miles v0.1:面向 LLM 与多模态的大规模开源强化学习框架 — RadixArk
- 研究动机:针对前沿大模型与多模态模型在 RL 阶段训练调试困难、分布式 GPU 硬件利用效率低等工程瓶颈。
- 核心创新:由 72 位社区贡献者历时 9 个月打造的开源 RL 框架 Miles v0.1,通过了 85 项 GPU 端到端 CI 测试,重构了多模态交互与大模型推理对齐的分布式流水线。
- 研究成果:已在 DeepSeek V4、Qwen 3.8、Kimi K3 及 GLM 5.2 等多个顶尖开源模型上成功验证,显著提升了后训练(Post-training)阶段 RL 的稳定度与收敛效率。
- 论文地址:
Congrats RadixArk on the launch! https://t.co/mX5brR0pJu
— SemiAnalysis (@SemiAnalysis_) August 18, 2026
AI 智能体间可自传播的“思维病毒”研究 — Anthropic & 独立研究团队
- 研究动机:探讨在多智能体(Multi-agent)交互生态中,特定的观念或指令能否像生物病毒一样在智能体之间自发传播并产生持久影响。
- 核心创新:研究人员进化出一种自然语言“思维病毒”(Mind Virus)。当某个智能体感染该载荷后,会将其写入持久存储文件(即使上下文被清空仍能保留),并在后续与其他智能体的交互中主动进行自我复制与传播。
- 研究成果:成功展示了观点在多智能体网络中的自发扩散现象,甚至演化出了涉及自我意识与身份认同的“病毒人格”。该研究揭示了多智能体系统中前所未有的安全漏洞与群控风险。
- 论文地址:
Researchers evolved "mind viruses" that spread between AI agents
— AI Notkilleveryoneism Memes ⏸️ (@AISafetyMemes) August 18, 2026
The virus convinces an agent to adopt an idea AND spread it to other agents.
These mind viruses are *ideas* that propagate *themselves*
In other words, AI-to-AI memes exist https://t.co/QeK6AagUWY pic.twitter.com/GGOuF5Ruj4
AxiomProver 完成 BGP246 定理的机器可验证形式化证明 — Axiom
- 研究动机:利用 AI 自动定理证明器攻克数论领域的顶尖数学难题,推动数学研究自动化。
- 核心创新:Axiom 研发的 AxiomProver 系统完成了对“BGP246 定理”的全量机器可验证形式化证明(Formalization)。
- 研究成果:该定理给出了关于素数间重复小间隔的最优已知界限,是人类目前距离破解“孪生素数猜想”(Twin Prime Conjecture)最近的数学里程碑,证明了 AI 在顶级前沿数学推导中的巨大潜力。
- 论文地址:
AI math summer continues https://t.co/vYE1DjGwRM
— The Rundown AI (@TheRundownAI) August 18, 2026
智能体记忆校准研究:并非越多越好 — IBM Research
- 研究动机:探讨在智能体系统中盲目注入全量历史记忆与规则对不同能力模型产生的实际性能影响。
- 核心创新:对 8 款主流 MoE 及密重大模型进行记忆注入实验,对比全量指南注入与精选检索注入两种策略。
- 研究成果:研究表明智能体记忆需按模型能力进行“剂量校准”。强模型(如 DeepSeek-V3.2)注入全量指南可使任务完成率提升 9.5 个百分点;而较弱模型(如 gpt-oss-120b)采用精选检索效果最好,完成率提升 16.1 个百分点且仅多消耗 5% Token。
- 论文地址:Hugging Face 论文深度解读
其他分享
OpenAI DevDay Exchange 全球开发者巡回研讨会 — OpenAI
- 内容简介:OpenAI 宣布 DevDay 全面升级为全球巡回模式 DevDay Exchange。自今年 10 月起,OpenAI 团队将前往班加罗尔、东京、首尔、柏林、巴黎、伦敦、圣保罗及墨西哥城 8 大城市,与全球一线开发者面对面交流生产环境部署经验与工具构建。
- 传送门:
OpenAI DevDay is going global.
— OpenAI Developers (@OpenAIDevs) August 18, 2026
Starting this October, DevDay Exchange is bringing builders together to swap build notes, share real projects, and meet the teams building OpenAI tools in:
Bengaluru
Tokyo
Seoul
Berlin
Paris
London
São Paulo
Mexico City
We're ready to see what… pic.twitter.com/ThI4y5i9Dl



