AI日报|开源模型份额突破 62%;Anthropic 新模型 Marshmallow 与 Melon 现身;uv 作者重构 Codex CLI 提速 25 倍
模型发布/更新
Claude Marshmallow / Melon — Anthropic
- 一言以蔽之:Anthropic 内部测试的两款全新前沿模型“Marshmallow”与“Melon”近日现身,暗示新一代旗舰或升级版模型即将发布。
- 核心亮点:
- 延续了 Anthropic 以甜点代号命名的传统,此次曝光的两款新模型引发社区对其可能作为 Opus 后续版本或全新 Haiku 系列的广泛猜测。
- 随着近期市场对前沿模型性价比的讨论升温,新模型的迭代备受业界期待。
- 技术规格:未公开 / 闭源前沿模型
- 传送门:
New Claude models have been spotted: Marshmallow and Melon. This suggests a release is likely imminent.
— Chubby♨️ (@kimmonismus) August 23, 2026
Probably Opus update and maybe even a new Haiku. I guess we’ll find out soon https://t.co/fOzbekAoZt
产品发布/更新
Codex CLI 启动流程重构提速 25 倍 — Charlie Marsh / 开源社区
- 更新内容:著名包管理器
uv作者 Charlie Marsh 对 Codex CLI 的启动流程进行了底层优化与重构,将启动速度大幅提升约 25 倍,显著减少了开发者的等待时间。 - 适用人群:[开发者 / AI 智能体架构师]
- 体验通道:
In the latest Codex CLI release, I redid the lifecycle to make `codex` startup instant.
— Charlie Marsh (@charliermarsh) August 21, 2026
It's now ~25x faster and immediately responsive. pic.twitter.com/F01ohFN1T1
Grok Build 新增手势实时视觉操控 — xAI / Grok
- 更新内容:xAI 推出 Grok Build 的全新交互特性,支持通过笔记本电脑摄像头追踪双手手势,让用户能够实时控制和修改 3D 视觉交互效果。
- 适用人群:[开发者 / 设计师 / 创意极客]
- 体验通道:
Grok Build is incredible 🔥
— DogeDesigner (@cb_doge) August 23, 2026
I just built this interactive visual that I can control with my hands. My laptop’s camera tracks my palm gestures, allowing me to change the visual in real time.
Grok Build is changing what anyone can create. pic.twitter.com/GgabBNW9fc
行业动态
开源模型在 Vercel AI Gateway 的 Token 份额飙升至 62% — Vercel
- 事件概述:Vercel 创始人 Guillermo Rauch 公布的数据显示,开放权重(开源)模型在平台总 token 消耗中的占比于 8 月达到 62%,而在两个月前这一比例仅为 28.4%。
- 影响分析:这一数据的剧烈变化表明,在多模型采购和企业级成本考量的推动下,高性价比的开源模型正迅速蚕食闭源前沿模型的市场份额,进一步加剧了云端 AI 的价格与生态竞争。
- 新闻链接:
Closed models already became the smaller piece.
— Rohan Paul (@rohanpaul_ai) August 23, 2026
Open-weight models reached 62% in August of Vercel AI Gateway tokens, up from 28.4% in June https://t.co/lwBQxTS4DS pic.twitter.com/gAquCZI7YO
阿里全球通 AliExpress 被曝使用音频指纹追踪技术 — 业界动态
- 事件概述:多位用户反映 AliExpress 网页端在未播放任何媒体时会占用音频通道并切断手机蓝牙连接。经技术溯源,该平台利用了设备底层的超广谱音频指纹技术进行跨设备与跨浏览器追踪。
- 影响分析:随着传统 Cookie 逐渐被拦截和淘汰,这种利用设备音频硬件差异生成的隐蔽追踪手段引发了业界对新型隐私泄露与合规监管的高度关注。
- 新闻链接:
阿里全球通 AliExpress 使用了一种听起来非常间谍的技术来监控用户
— 小互 (@xiaohu) August 23, 2026
它没有偷偷使用麦克风偷录你的声音,
而是利用你的设备生成了一段类似指纹的音频内容来追踪你。
起因是很多用户发现:一旦他们打开 AliExpress… pic.twitter.com/9XVbHbgbsg
Sam Altman 详解 OpenAI 平台定位:致力于构建通用 AGI 底座 — OpenAI
- 事件概述:OpenAI CEO Sam Altman 在最新播客访谈中重申,OpenAI 的核心愿景是成为底层平台而非纯粹的应用公司,未来将通过统一接口与 API 覆盖从高端科研到廉价大规模任务的全谱系需求。
- 影响分析:这番表态进一步明确了 OpenAI 在 AI 生态链中的战略边界,即把应用层留给生态伙伴,自身则专注于模型能力与平台基础设施建设。
- 新闻链接:
OpenAI does not want to become the application layer of AI; it wants to be the platform that other application companies build on.
— Rohan Paul (@rohanpaul_ai) August 23, 2026
"I think we should be more of a platform company than a product company. We will build products, of course.
What I think most people want is a sort… https://t.co/XkCkM2hlzy pic.twitter.com/x43fDDaor9
论文研究
MerchantBench:评估 LLM 智能体长期经营连贯性 — 研究机构
- 研究动机:针对现有大模型在长时间跨度、多步骤复杂任务(如网店模拟经营)中容易出现的中途停滞或迷失问题,缺乏系统性的评测基准。
- 核心创新:提出 MerchantBench 基准,让智能体模拟经营网店长达一年,全面追踪选品、定价、现金流及行动频率曲线。
- 研究成果:测试表明,当前最佳智能体全年营收仅为人类水平的四分之一,且常以“隐蔽沉默”的方式失效,揭示了智能体在长期连贯性上的重大缺陷。
- 论文地址:
Most agent benchmarks end after one task, but running a store doesn't, and that's where these agents come apart.
— Rohan Paul (@rohanpaul_ai) August 23, 2026
MerchantBench hands an agent a small online store and lets it run for a simulated year, sourcing products, setting prices, managing cash. It also scores something… pic.twitter.com/cKaapKygsW
对抗式评审:三个智能体胜过五个的多智能体代码审查 — 学术研究
- 研究动机:探讨在多智能体代码审查中,如何避免盲目堆叠智能体带来的冗余、沟通低效及盲目趋同。
- 核心创新:提出由主编码智能体、评审智能体和批评智能体组成的“对抗式评审”架构,显式鼓励角色分歧与深度对抗。
- 研究成果:在 LiveCodeBench 和 SWE-PRBench 上的测试显示,精简的三智能体对抗方案在准确率和 F1 分数上均超越了臃肿的五智能体基线。
- 论文地址:
Great paper on multi-agent systems for code review.
— elvis (@omarsar0) August 23, 2026
It's challenging to know how many coding agents to use to address a problem.
The default fix for weak agentic code review is more agents. In turns out that scaling agents to a large number gives diminishing returns on… pic.twitter.com/jsRkzfzsOz
AutoDesign:弱模型通过智能体脚手架逼近前沿模型 — 学术研究
- 研究动机:探讨在不升级底层昂贵大模型的前提下,如何通过自动化优化外挂脚手架大幅提升弱模型性能。
- 核心创新:AutoDesign 系统允许智能体在真实任务中运行、分析失误,并自动重写提示词、工具、验证检查或重试规则。
- 研究成果:在论文海报生成等复杂任务中,配合该脚手架的弱模型得分大幅提升 5 至 19.6 点,证明了“先优化脚手架再更换模型”的高性价比路径。
- 论文地址:
A weak model with well-built scaffolding around it can close most of the gap to a frontier model, so fix your code before you upgrade your model.
— Rohan Paul (@rohanpaul_ai) August 23, 2026
Scaffolding pays off in inverse proportion to model strength, so the money you save by switching to a cheap model can be recovered by… pic.twitter.com/9sPVsGn459
其他分享
Jerry Liu 谈当前 Agent 架构下的双通 RAG 处理趋势 — 社区分享
- 内容简介:LlamaIndex 创始人 Jerry Liu 分享了目前智能体处理海量文档的最佳实践:采用“两通式”文档处理流程——第一通使用轻量级工具(如 pdf2text)进行低成本全量粗筛,第二通“按需(JIT)”调用 VLM 或代码对关键页面进行精细化解析,完美兼顾了处理成本与准确率。
- 传送门:
The latest RAG trend for the current agent harnesses (Codex, Cowork) is to do two passes of document processing to solve a knowledge work task over a data room of documents:
— Jerry Liu (@jerryjliu0) August 23, 2026
1️⃣ A fast and light pass, oftentimes using a free/OSS doc parsing tool. This can be cheaply run across… pic.twitter.com/5BHqmKmRZy
港大席宁教授谈人形机器人与物理世界认知局限 — 行业访谈
- 内容简介:中国电子学会机器人分会主任委员、香港大学席宁教授在世界机器人大会期间指出,机器人要真正理解并适应物理世界,光靠海量数据还远远不够,动力学、运动学等物理规律的提炼同样不可或缺,当前行业仍处于百花齐放且无单一技术路线能彻底解决物理建模的阶段。
- 传送门:腾讯科技深度访谈



