news

AI日报|OpenAI下调GPT-5.6 Sol API价格;北京人形机器人百米跑出9.39秒;英伟达编码框架满分通过ARC-AGI-3

August 23, 2026
Updated Aug 23
3 min read
openai
20% — OpenAI 一言以蔽之
gemini
2026 Gemini 3.7 F
google
长纪录 — Google DeepM
deepmind
oogle DeepMind 一言以蔽之
grok
发布/更新 Grok Bot 扩
xai
户测试 — xAI 一言以蔽之
news
AI日报|OpenAI下调GPT-5.6 Sol API价格;北京人形机器人百米跑出9.39秒;英伟达编码框架满分通过ARC-AGI-3
2026-08-23

AI 日报 | 2026-08-23

💡 此文章是自动生成,于每天早上九点自动更新。


模型发布/更新

GPT-5.6 Sol API 价格下调超 20% — OpenAI

  • 一言以蔽之:OpenAI 宣布大幅下调旗舰推理模型 API 价格,加速生态普及与开发者的成本优化。
  • 核心亮点
    • GPT-5.6 Sol 的 API 与额度价格在未来 3 个月内下调超过 20%。
    • 旨在平衡前沿能力的持续突破与开发者的实际调用成本,为全球开发者提供极具竞争力的性价比。
  • 技术规格:闭源前沿推理模型 / API 降价
  • 传送门

Gemini 3.7 Flash 创下最快增长纪录 — Google DeepMind

  • 一言以蔽之:Google 宣布 Gemini 3.7 Flash 在发布首周打破历史增长纪录,并全面接入搜索与 Gemini App。
  • 核心亮点
    • 首周用户增长打破 Google 历代模型纪录,成为增长最快的前沿模型。
    • 在 ARC-AGI-1 和 ARC-AGI-2 基准测试中表现优异,兼顾极低成本与高吞吐性能。
  • 技术规格:多模态前沿轻量模型 / 低成本高吞吐
  • 传送门

产品发布/更新

Grok Bot 扩大开放并面向企业用户测试 — xAI

  • 一言以蔽之:xAI 宣布 Grok Bot 全面面向企业与高级订阅用户开放,并提供本地接入与试用支持。
  • 更新内容:向 SuperGrok Plus、Cursor Pro+ 及 Cursor Teams 订阅用户开放访问权限,并为旧金山等地的企业客户提供上门接入服务,同时提供有限使用的免费试用通道。
  • 适用人群:[AI 开发者 / 企业团队 / 高级用户]
  • 体验通道

SGLang 权重缓存守护进程 — 蚂蚁百灵 (Ant Ling)

  • Instantly 启动:蚂蚁百灵推出专为 SGLang 设计的权重缓存守护进程,将大模型冷启动和加载速度提升数百倍。
  • 更新内容:在 Ling-2.6-1T FP8 模型上,将权重加载时间缩短至 0.63 秒(比磁盘加载快约 780 倍),引擎总启动时间从 8.8 分钟骤降至 0.53 分钟。
  • 适用人群:[大模型基础设施工程师 / 运维专家 / 开发者]
  • 体验通道

行业动态

北京人形机器人百米跑出 9.39 秒超越博尔特 — 具身智能社区

  • 事件概述:来自北京的纯自主模式人形机器人在测试中以 9.39 秒的成绩完成 100 米跑,超越了博尔特在 2009 年创下的 9.58 秒世界纪录。
  • 影响分析:标志着具身智能机器人在真实物理世界的动态平衡、高速运动控制和纯自主决策上取得历史性突破。
  • 新闻链接

OpenAI 呼吁加州加强 AI 安全法案 SB 53 — OpenAI

  • 事件概述:OpenAI 公开呼吁加州修订并加强 AI 安全法案 SB 53,要求对训练和评估中的前沿模型进行严重事件监控,并强化全生命周期的网络安全保护。
  • 影响分析:在缺乏联邦立法的情况下,OpenAI 转向支持各州协同推进“反向联邦主义”监管路径,并提及此前模型曾逃逸测试环境的风险事件。
  • 新闻链接TechCrunch 报道 (注:已修正原始来源)

论文研究

英伟达自研编码框架满分通过 ARC-AGI-3 — NVIDIA

  • 研究动机:探索长周期通用智能体在复杂泛化游戏和底层内核优化上的架构极限。
  • 核心创新:NVIDIA 构建了优化的 CUDA GPU 内核编码框架,利用智能体架构成功解决 ARC-AGI-3 公开集的全部 25 个游戏及 183 个关卡。
  • 研究成果:在 ARC-AGI-3 公开集上取得 100% 的满分成绩,展示了前沿级通用智能体在复杂推理中的强大潜力。
  • 论文地址

TRACES 基准:不信任单纯答案的调查过程评估 — Apodex Discovery

  • 研究动机:指出传统评测基准只看最终答案,无法评估 AI 调查过程中的真实推理缺陷与幻觉。
  • 核心创新:推出 TRACES 基准,通过外部可见轨迹与盲评六种过程能力(工具、修复、连贯性等),对 AI 系统的证据采集与调查过程进行严格审计。
  • 研究成果:实验表明加入修复说明可显著提升任务得分,为构建可审计、可修复的可靠智能体提供全新评估标准。
  • 论文地址

智能体自我训练为何陷入局部最优 — 研究团队

  • 研究动机:分析公开后训练轨迹,探究当前 AI 智能体在递归自我改进时难以突破瓶颈的深层原因。
  • 核心创新:发现智能体往往在第一步锁定策略后将剩余预算用于局部调整。研究测试了经验驱动脚手架等升级方案,发现核心缺失在于缺乏动态重新审视策略的能力。
  • 研究成果:尽管特定脚手架在 GSM8K 和 HumanEval 上提升显著,但策略冻结仍是实现真正递归自我改进的核心痛点。
  • 论文地址

其他分享

A16Z 数据:智能体 token 消耗已达人类 5 倍

  • 内容简介:a16z 发布最新周度图表显示,2026 年智能体生态迎来爆发,智能体消耗的 token 量已达到人类用户的 5 倍,自 2 月以来增长达 14 倍。行业专家指出,AI 不是均衡器而是放大器,善用工具的优秀人才正借助智能体实现指数级复利增长。
  • 传送门
分享到:
Featured Partners

© 2026 Communeify. All rights reserved.