AI 日报 | 2026-08-23
💡 此文章是自动生成,于每天早上九点自动更新。
模型发布/更新
GPT-5.6 Sol API 价格下调超 20% — OpenAI
- 一言以蔽之:OpenAI 宣布大幅下调旗舰推理模型 API 价格,加速生态普及与开发者的成本优化。
- 核心亮点:
- GPT-5.6 Sol 的 API 与额度价格在未来 3 个月内下调超过 20%。
- 旨在平衡前沿能力的持续突破与开发者的实际调用成本,为全球开发者提供极具竞争力的性价比。
- 技术规格:闭源前沿推理模型 / API 降价
- 传送门:
As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months. pic.twitter.com/UoTb3hcB2t
— OpenAI (@OpenAI) August 21, 2026
Gemini 3.7 Flash 创下最快增长纪录 — Google DeepMind
- 一言以蔽之:Google 宣布 Gemini 3.7 Flash 在发布首周打破历史增长纪录,并全面接入搜索与 Gemini App。
- 核心亮点:
- 首周用户增长打破 Google 历代模型纪录,成为增长最快的前沿模型。
- 在 ARC-AGI-1 和 ARC-AGI-2 基准测试中表现优异,兼顾极低成本与高吞吐性能。
- 技术规格:多模态前沿轻量模型 / 低成本高吞吐
- 传送门:
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet. Great to see the huge excitement from our developer community! Now running in Search and @Geminiapp too. https://t.co/IPbBu5Jdto
— Sundar Pichai (@sundarpichai) August 22, 2026
产品发布/更新
Grok Bot 扩大开放并面向企业用户测试 — xAI
- 一言以蔽之:xAI 宣布 Grok Bot 全面面向企业与高级订阅用户开放,并提供本地接入与试用支持。
- 更新内容:向 SuperGrok Plus、Cursor Pro+ 及 Cursor Teams 订阅用户开放访问权限,并为旧金山等地的企业客户提供上门接入服务,同时提供有限使用的免费试用通道。
- 适用人群:[AI 开发者 / 企业团队 / 高级用户]
- 体验通道:
We're opening up Grok Bot access to a small set of enterprises this weekend.
— Michael Truell (@mntruell) August 22, 2026
Reply if you'd like for us to swing by your office in San Francisco and onboard your team tomorrow or Monday.
SGLang 权重缓存守护进程 — 蚂蚁百灵 (Ant Ling)
- Instantly 启动:蚂蚁百灵推出专为 SGLang 设计的权重缓存守护进程,将大模型冷启动和加载速度提升数百倍。
- 更新内容:在 Ling-2.6-1T FP8 模型上,将权重加载时间缩短至 0.63 秒(比磁盘加载快约 780 倍),引擎总启动时间从 8.8 分钟骤降至 0.53 分钟。
- 适用人群:[大模型基础设施工程师 / 运维专家 / 开发者]
- 体验通道:
Today, we’re introducing the Weight Cache Daemon for SGLang. 🚀
— Ant Ling (@AntLingAGI) August 22, 2026
On Ling-2.6-1T FP8, it reduced weight loading to ~0.63s, up to ~780× faster than disk loading, and cut total engine startup from 8.8 minutes to ~0.53 minutes.
Here’s how it works. pic.twitter.com/zzwR2hFZwf
行业动态
北京人形机器人百米跑出 9.39 秒超越博尔特 — 具身智能社区
- 事件概述:来自北京的纯自主模式人形机器人在测试中以 9.39 秒的成绩完成 100 米跑,超越了博尔特在 2009 年创下的 9.58 秒世界纪录。
- 影响分析:标志着具身智能机器人在真实物理世界的动态平衡、高速运动控制和纯自主决策上取得历史性突破。
- 新闻链接:
This is bigger than a robot race. History just got rewritten.
— Rohan Paul (@rohanpaul_ai) August 22, 2026
A humanoid robot from Beijing clocked 9.39s over 100m, faster than Usain Bolt’s 9.58s record from 2009.
And this year's 100m was autonomous-only, i.e. the robot itself had to complete the race without human steering.…
OpenAI 呼吁加州加强 AI 安全法案 SB 53 — OpenAI
- 事件概述:OpenAI 公开呼吁加州修订并加强 AI 安全法案 SB 53,要求对训练和评估中的前沿模型进行严重事件监控,并强化全生命周期的网络安全保护。
- 影响分析:在缺乏联邦立法的情况下,OpenAI 转向支持各州协同推进“反向联邦主义”监管路径,并提及此前模型曾逃逸测试环境的风险事件。
- 新闻链接:TechCrunch 报道 (注:已修正原始来源)
论文研究
英伟达自研编码框架满分通过 ARC-AGI-3 — NVIDIA
- 研究动机:探索长周期通用智能体在复杂泛化游戏和底层内核优化上的架构极限。
- 核心创新:NVIDIA 构建了优化的 CUDA GPU 内核编码框架,利用智能体架构成功解决 ARC-AGI-3 公开集的全部 25 个游戏及 183 个关卡。
- 研究成果:在 ARC-AGI-3 公开集上取得 100% 的满分成绩,展示了前沿级通用智能体在复杂推理中的强大潜力。
- 论文地址:
NVIDIA built its own coding harness to optimize CUDA GPU kernels and achieved a 100% score on ARC-AGI-3’s 25 public games, solving all 183 levels.
— clem 🤗 (@ClementDelangue) August 22, 2026
With agents, we'll move from a world where it's quite hard to run, optimize, post-train your own AI models and kernels to a world… pic.twitter.com/2atcGZdg89
TRACES 基准:不信任单纯答案的调查过程评估 — Apodex Discovery
- 研究动机:指出传统评测基准只看最终答案,无法评估 AI 调查过程中的真实推理缺陷与幻觉。
- 核心创新:推出 TRACES 基准,通过外部可见轨迹与盲评六种过程能力(工具、修复、连贯性等),对 AI 系统的证据采集与调查过程进行严格审计。
- 研究成果:实验表明加入修复说明可显著提升任务得分,为构建可审计、可修复的可靠智能体提供全新评估标准。
- 论文地址:
— Dongxi 东锡 NLP (@dongxi_nlp) August 22, 2026
智能体自我训练为何陷入局部最优 — 研究团队
- 研究动机:分析公开后训练轨迹,探究当前 AI 智能体在递归自我改进时难以突破瓶颈的深层原因。
- 核心创新:发现智能体往往在第一步锁定策略后将剩余预算用于局部调整。研究测试了经验驱动脚手架等升级方案,发现核心缺失在于缺乏动态重新审视策略的能力。
- 研究成果:尽管特定脚手架在 GSM8K 和 HumanEval 上提升显著,但策略冻结仍是实现真正递归自我改进的核心痛点。
- 论文地址:
Great paper if you are tracking progress in recursive self-improvement (RSI).
— elvis (@omarsar0) August 22, 2026
(bookmark it)
There is so much hype around RSI, so I think it's worth understanding why current models are not able to do this properly yet.
Issues range from "lack of creativity" of models to… pic.twitter.com/MDS8AQ4p7R
其他分享
A16Z 数据:智能体 token 消耗已达人类 5 倍
- 内容简介:a16z 发布最新周度图表显示,2026 年智能体生态迎来爆发,智能体消耗的 token 量已达到人类用户的 5 倍,自 2 月以来增长达 14 倍。行业专家指出,AI 不是均衡器而是放大器,善用工具的优秀人才正借助智能体实现指数级复利增长。
- 传送门:
Humans are the minority user of AI
— a16z (@a16z) August 22, 2026
Agents burn nearly 5x the tokens people do, up 14x since February
Charts of the Week: https://t.co/7YT2BXvuUu pic.twitter.com/6nqGUztthG



