news

AI日报|开源模型份额突破 62%;Anthropic 新模型 Marshmallow 与 Melon 现身;uv 作者重构 Codex CLI 提速 25 倍

August 24, 2026
Updated Aug 24
4 min read
anthropic
破 62%;Anthropic 新模型 M
codex
作者重构 Codex CLI 提
claude
发布/更新 Claude Marsh
make
le to make `code
grok
2026 Grok Build
xai
觉操控 — xAI / Gro
news
AI日报|开源模型份额突破 62%;Anthropic 新模型 Marshmallow 与 Melon 现身;uv 作者重构 Codex CLI 提速 25 倍
2026-08-24

AI日报|开源模型份额突破 62%;Anthropic 新模型 Marshmallow 与 Melon 现身;uv 作者重构 Codex CLI 提速 25 倍


模型发布/更新

Claude Marshmallow / Melon — Anthropic

  • 一言以蔽之:Anthropic 内部测试的两款全新前沿模型“Marshmallow”与“Melon”近日现身,暗示新一代旗舰或升级版模型即将发布。
  • 核心亮点
    • 延续了 Anthropic 以甜点代号命名的传统,此次曝光的两款新模型引发社区对其可能作为 Opus 后续版本或全新 Haiku 系列的广泛猜测。
    • 随着近期市场对前沿模型性价比的讨论升温,新模型的迭代备受业界期待。
  • 技术规格:未公开 / 闭源前沿模型
  • 传送门

产品发布/更新

Codex CLI 启动流程重构提速 25 倍 — Charlie Marsh / 开源社区

  • 更新内容:著名包管理器 uv 作者 Charlie Marsh 对 Codex CLI 的启动流程进行了底层优化与重构,将启动速度大幅提升约 25 倍,显著减少了开发者的等待时间。
  • 适用人群:[开发者 / AI 智能体架构师]
  • 体验通道

Grok Build 新增手势实时视觉操控 — xAI / Grok

  • 更新内容:xAI 推出 Grok Build 的全新交互特性,支持通过笔记本电脑摄像头追踪双手手势,让用户能够实时控制和修改 3D 视觉交互效果。
  • 适用人群:[开发者 / 设计师 / 创意极客]
  • 体验通道

行业动态

开源模型在 Vercel AI Gateway 的 Token 份额飙升至 62% — Vercel

  • 事件概述:Vercel 创始人 Guillermo Rauch 公布的数据显示,开放权重(开源)模型在平台总 token 消耗中的占比于 8 月达到 62%,而在两个月前这一比例仅为 28.4%。
  • 影响分析:这一数据的剧烈变化表明,在多模型采购和企业级成本考量的推动下,高性价比的开源模型正迅速蚕食闭源前沿模型的市场份额,进一步加剧了云端 AI 的价格与生态竞争。
  • 新闻链接

阿里全球通 AliExpress 被曝使用音频指纹追踪技术 — 业界动态

  • 事件概述:多位用户反映 AliExpress 网页端在未播放任何媒体时会占用音频通道并切断手机蓝牙连接。经技术溯源,该平台利用了设备底层的超广谱音频指纹技术进行跨设备与跨浏览器追踪。
  • 影响分析:随着传统 Cookie 逐渐被拦截和淘汰,这种利用设备音频硬件差异生成的隐蔽追踪手段引发了业界对新型隐私泄露与合规监管的高度关注。
  • 新闻链接

Sam Altman 详解 OpenAI 平台定位:致力于构建通用 AGI 底座 — OpenAI

  • 事件概述:OpenAI CEO Sam Altman 在最新播客访谈中重申,OpenAI 的核心愿景是成为底层平台而非纯粹的应用公司,未来将通过统一接口与 API 覆盖从高端科研到廉价大规模任务的全谱系需求。
  • 影响分析:这番表态进一步明确了 OpenAI 在 AI 生态链中的战略边界,即把应用层留给生态伙伴,自身则专注于模型能力与平台基础设施建设。
  • 新闻链接

论文研究

MerchantBench:评估 LLM 智能体长期经营连贯性 — 研究机构

  • 研究动机:针对现有大模型在长时间跨度、多步骤复杂任务(如网店模拟经营)中容易出现的中途停滞或迷失问题,缺乏系统性的评测基准。
  • 核心创新:提出 MerchantBench 基准,让智能体模拟经营网店长达一年,全面追踪选品、定价、现金流及行动频率曲线。
  • 研究成果:测试表明,当前最佳智能体全年营收仅为人类水平的四分之一,且常以“隐蔽沉默”的方式失效,揭示了智能体在长期连贯性上的重大缺陷。
  • 论文地址

对抗式评审:三个智能体胜过五个的多智能体代码审查 — 学术研究

  • 研究动机:探讨在多智能体代码审查中,如何避免盲目堆叠智能体带来的冗余、沟通低效及盲目趋同。
  • 核心创新:提出由主编码智能体、评审智能体和批评智能体组成的“对抗式评审”架构,显式鼓励角色分歧与深度对抗。
  • 研究成果:在 LiveCodeBench 和 SWE-PRBench 上的测试显示,精简的三智能体对抗方案在准确率和 F1 分数上均超越了臃肿的五智能体基线。
  • 论文地址

AutoDesign:弱模型通过智能体脚手架逼近前沿模型 — 学术研究

  • 研究动机:探讨在不升级底层昂贵大模型的前提下,如何通过自动化优化外挂脚手架大幅提升弱模型性能。
  • 核心创新:AutoDesign 系统允许智能体在真实任务中运行、分析失误,并自动重写提示词、工具、验证检查或重试规则。
  • 研究成果:在论文海报生成等复杂任务中,配合该脚手架的弱模型得分大幅提升 5 至 19.6 点,证明了“先优化脚手架再更换模型”的高性价比路径。
  • 论文地址

其他分享

Jerry Liu 谈当前 Agent 架构下的双通 RAG 处理趋势 — 社区分享

  • 内容简介:LlamaIndex 创始人 Jerry Liu 分享了目前智能体处理海量文档的最佳实践:采用“两通式”文档处理流程——第一通使用轻量级工具(如 pdf2text)进行低成本全量粗筛,第二通“按需(JIT)”调用 VLM 或代码对关键页面进行精细化解析,完美兼顾了处理成本与准确率。
  • 传送门

港大席宁教授谈人形机器人与物理世界认知局限 — 行业访谈

  • 内容简介:中国电子学会机器人分会主任委员、香港大学席宁教授在世界机器人大会期间指出,机器人要真正理解并适应物理世界,光靠海量数据还远远不够,动力学、运动学等物理规律的提炼同样不可或缺,当前行业仍处于百花齐放且无单一技术路线能彻底解决物理建模的阶段。
  • 传送门腾讯科技深度访谈
分享到:
Featured Partners

© 2026 Communeify. All rights reserved.