AI日报|阿里开源 Qwen3.8-27B 与万相 3.0;Meta 连发 MetaRoCE 协议与自研 MTIA 300 芯片;xAI 推出 Grok Voice 2.0
模型发布/更新
Qwen3.8-27B — 阿里通义千问
- 一言以蔽之:阿里通义千问正式开源 Qwen3.8-27B 稠密多模态模型,以 27B 参数量重塑开发与办公工作流的性价比边界。
- 核心亮点:
- 原生支持 262K 上下文窗口,结合 YaRN 技术可无缝扩展至 1M token,整体性能全面超越前代 Qwen3.7-Plus。
- 采用 Apache 2.0 宽松开源协议,在 Code Arena: WebDev 评测榜单上位列全球第 9,成为排名前十中唯一的 27B 级别轻量模型。
- 技术规格:27B / 开源(Apache 2.0)/ Code Arena 得分 1595 分
- 传送门:
Exciting news: Qwen3.8-27B by @Alibaba_Qwen just landed in Code Arena: WebDev at #9 overall with 1595 pts. It is the only model in its size class in the top 10, and also reshapes the Pareto Frontier!
— Arena.ai (@arena) August 24, 2026
It is only 6 ranks behind the much larger Qwen3.8-Max. For scale: Gemma 4-31B… https://t.co/i5SztFn4Xh pic.twitter.com/KjJWrO08Wi
万相 3.0(WAN 3.0)多模态视频模型 — 阿里巴巴
- 一言以蔽之:阿里万相 3.0 视频音频联合生成模型全面上线,同步接入 Runway、Replicate 及 OpenRouter 等主流云平台。
- 核心亮点:
- 支持单次生成原生 30 秒单镜头长视频并生成高度同步的高保真音效,最多可引入 20 个图像、视频或音频参考素材。
- 支持 480p、720p 及 1080p 多分辨率输出,API 生成定价相比海外同类竞品降幅最高达 35%。
- 技术规格:多模态视频与音频联合生成 / 云端 API 开放
- 传送门:
WAN 3.0 is now on Runway.
— Runway (@runwayml) August 24, 2026
Generate state-of-the-art video and audio with multiple image, video and audio reference inputs. Try it now at the link below. pic.twitter.com/VzTkPZR3cz
GPT-5.6 家族深度适配 Kiro 智能体 — OpenAI & AWS
- 一言以蔽之:OpenAI 与 AWS 联合优化,将 GPT-5.6 Sol、Terra 与 Luna 模型家族正式引入软件开发智能体 Kiro。
- 核心亮点:
- 在 Terminal-Bench 2.1 编程基准测试中,GPT-5.6 Terra 在 Kiro 内完成端到端复杂工程任务的调用成本大幅降低约 82%。
- 通过更高的单 Token 信息密度与更精准的工具调用,显著减少了智能体在代码编写与调试过程中的多轮无效循环。
- 技术规格:闭源模型家族 / Kiro 平台原生集成
- 传送门:OpenAI 官方博客
产品发布/更新
Grok Voice Think Fast 2.0 与 Agent Builder API — xAI / SpaceX
- 更新内容:xAI 推出全新实时语音模型 Grok Voice 2.0,在 Artificial Analysis 语音评测指数中位居第一(语音推理准确率 97.2%,任务成功率 94.7%)。SpaceX 透露该模型已在 Starlink 大规模落地,日均接听处理超 1.5 万通客服电话并自动完成硬件诊断与订单寄送。
- 适用人群:[智能体开发者 / 企业架构师 / 智能客服产品经理]
- 体验通道:
Grok Voice Think Fast 2.0 available via API or in our Agent Builder. Head to https://t.co/ZKLH1N6rs4 to build, tune, and deploy your voice agents.
— SpaceXAI (@SpaceXAI) August 24, 2026
Learn more: https://t.co/XUiX1CnWV1
Visual Studio 推出“自带模型”(BYOM)预览功能 — 微软
- 更新内容:Visual Studio 在 Community、Professional 及 Enterprise 全版本中默认开放 BYOM(Bring Your Own Model)预览支持。开发者可自由接入自选的本地模型、开源端点或企业内控模型,打破了传统 IDE 绑定单一 AI 模型的限制。
- 适用人群:[软件开发者 / 企业开发团队]
- 体验通道:Microsoft 官方开发者博客
Claude Code v2.1.243 与流式渲染 4 倍提速 — Anthropic
- 更新内容:Claude Code 升级至 v2.1.243 版本,新增
/usage的 Loops 细分统计、自定义 modelPicker 配置与免密钥登录支持;同时 Claude 网页与桌面客户端流式输出完成局部更新重构,流畅度提升约 4 倍,MacBook 120Hz 屏幕下可保持满帧渲染。 - 适用人群:[开发者 / 深度内容创作者]
- 体验通道:Claude Code GitHub 仓库
Junie Local:本地免配置运行的编程智能体 — JetBrains
- 更新内容:JetBrains 推出 Junie Local,支持在 Mac 设备(如 M5 系列)上单条命令免配置部署 4-bit 量化的 Qwen3.6-27B 模型,智能体完全在本地执行推理循环,实现零 Token 费用且代码完全不出本地。
- 适用人群:[开发者 / 对代码隐私有极高要求的研发团队]
- 体验通道:JetBrains 官方博客
ElevenLabs CLI v1 命令行工具 — ElevenLabs
- 更新内容:ElevenLabs 发布官方 CLI v1,将全量音频生成与管理 API 完整接入终端环境,原生适配编程智能体,支持结构化 JSON 数据交互与 Dry Run 预检执行。
- 适用人群:[AI 智能体开发者 / 音视频工程人员]
- 体验通道:
Today we are releasing ElevenLabs CLI v1, which brings the entire ElevenLabs API into the terminal. https://t.co/03QqQSEK3K
— ElevenLabs (@ElevenLabs) August 24, 2026
v0 开放连接 100+ 款第三方外部服务 — Vercel
- 更新内容:Vercel 推出 Vercel Connect,v0 智能体与生成的全栈应用现可一键直连 Slack、Google、Notion、GitHub 等百余款服务,底层由平台自动分发短期鉴权令牌,免除手动配置长效密钥的繁琐流程与安全风险。
- 适用人群:[独立开发者 / 全栈工程师 / 自动化流程搭建者]
- 体验通道:Vercel 更新日志
行业动态
MetaRoCE 开源:专为百万 GPU 打造的以太网 RDMA 传输协议 — Meta
- 事件概述:Meta 正式向开放计算项目(OCP)开源了专为大规模 AI 工作负载设计的 MetaRoCE 协议规范与参考实现。该协议将网络调度逻辑移至终端,原生支持乱序交付、多路径负载与双向拥塞控制,无需依赖复杂的 PFC(优先级流控)。
- 影响分析:MetaRoCE 显著提升了通用以太网在百万卡 GPU 规模下的吞吐能力并压低了尾延迟,进一步加速了以太网在超大 AI 集群中替代 InfiniBand 等专有网络协议的行业趋势。
- 新闻链接:Meta 官方工程博客
Meta 揭秘首款集成网卡的自研训练芯片 MTIA 300 — Meta
- 事件概述:Meta 披露了专为推荐与排序模型设计的定制加速芯片 MTIA 300,该芯片在封装内集成了专用 NIC Chiplet 与通信卸载引擎,并协同开发了专有 HCCL 通信库。
- 影响分析:针对推荐系统“高通信带宽、低浮点强度”的特殊架构瓶颈,MTIA 300 展现出远超通用 GPU 的训练效率与能耗优势,代表了头部云厂商定制专用领域芯片(ASIC)的最新成果。
- 新闻链接:Meta 官方工程博客
NVIDIA Vera Rubin NVL72 智能体负载实测:能效达 GB300 的 30 倍 — NVIDIA
- 事件概述:NVIDIA 公布 Vera Rubin NVL72 实测数据:在长程 AI 智能体工作负载下,其每兆瓦吞吐量较 GB300 NVL72 提升最高达 30 倍,每百万 Token 的综合推理成本降至原来的 1/35。
- 影响分析:随着 AI 应用从简单的单轮对话转向高计算密度的自主智能体多步推理,每瓦算力与能耗比正成为下一代算力基础设施的核心决胜指标。
- 新闻链接:NVIDIA 官方博客
字节跳动整合 AI 办公业务:TRAE 与扣子并入豆包体系 — 字节跳动
- 事件概述:字节跳动宣布完成 AI 办公产品线整合,TRAE(含 TRAE Work、IDE 与 CLI)及扣子(Coze)团队整体并入豆包业务线,并将于近期推出面向办公场景的统一品牌“豆包工作”。
- 影响分析:此次重组进一步明确了豆包在字节跳动内部的 AI 核心主干地位,有助于集中技术和产品资源,加速全场景 AI 办公智能体的规模化落地。
- 新闻链接:
TRAE、扣子并入豆包
— 小互 (@xiaohu) August 24, 2026
字节将推统一办公品牌 "豆包工作"
字节跳动宣布对旗下的办公AI产品完成了一轮团队整合,TRAE、扣子(Coze)团队将整体并入豆包体系
其中TRAE Work、扣子将与豆包在工作场景的产品能力进行整合
TRAE IDE及CLI 将作为豆包品牌下的编程产品线持续发展… pic.twitter.com/yQOx0c4toz
Mistral AI 联手 HUMAIN 推进中东主权 AI 建设 — Mistral AI
- 事件概述:法国开源模型巨头 Mistral AI 与 HUMAIN 签署数亿欧元的战略合作协议,将在沙特阿拉伯及中东地区部署本地算力基础设施,联合研发阿拉伯语能力出众的前沿大模型,重点落地网络安全与语音等受监管领域。
- 影响分析:主权 AI 正成为非美主流大模型厂商拓展全球版图的重要战略支点,欧洲技术与中东资本的深度联合将推动全球 AI 基础设施多极化演进。
- 新闻链接:Mistral AI 官方博客
小米发布三款自研芯片:涵盖 3nm 旗舰 SoC 与晶圆级堆栈 AI 芯片 — 小米
- 事件概述:小米正式发布三颗玄戒自研芯片:第二代 3nm 旗舰手机 SoC“玄戒 O3”、全球首颗 6nm 晶圆级三层堆栈近存 AI 加速芯片“玄戒 O100”,以及国内首颗 3nm 智驾大算力芯片“玄戒 D100”。
- 影响分析:小米在端侧 AI 算力与自动驾驶芯片领域的垂直整合展现出极高迭代效率,展现了国内硬件企业在先进制程背景下探索晶圆级先进封装与软硬协同的新路径。
- 新闻链接:腾讯科技深度报道
论文研究
ACES:以“技能提升度”(Skill Lift)重构智能体评测 — NVIDIA
- 研究动机:企业在维护智能体技能库(Skill Libraries)时,通常依赖静态代码扫描进行审查,但研究发现静态指标与模型最终完成任务的表现几乎无相关性(Spearman 相关系数仅 0.14)。
- 核心创新:NVIDIA 提出 ACES 评估框架与“Skill Lift”指标,通过在相同沙箱和基座模型下,对比智能体“加载技能”与“未加载技能”执行同一任务的成对差异,并将执行轨迹标准化。
- 研究成果:在 4 种智能体框架、58 个生产技能和 947 个真实案例上的评测表明,Skill Lift 能精准量化技能在执行成功率、行为规范度与流程效率上的实质净增益。
- 论文地址:
Very interesting new paper from NVIDIA.
— elvis (@omarsar0) August 24, 2026
(bookmark it)
It takes a closer look at evaluating agent skills.
Enterprise teams are starting to leverage shared skill libraries, and the review gate is typically a scanner that checks structure, style, and security.
NVIDIA measured… pic.twitter.com/ySHI2NqFj5
长程规划智能体:在策略蒸馏(OPD)破解稀疏奖励瓶颈 — 学术研究
- 研究动机:后训练阶段难以修复大模型薄弱的长程规划能力,噪声轨迹累积误差与稀疏奖励常导致模型严重迷失或灾难性遗忘。
- 核心创新:研究提出在长程规划场景下应优先训练明确的世界模型,并在奖励稀疏时采用在策略蒸馏(On-Policy Distillation, OPD),将教师模型的引导信号贯穿整个决策轨迹而非仅依赖最终结果。
- 研究成果:在复杂长程任务与高噪声环境下,OPD 的表现显著优于依赖末端奖励的 GRPO 算法,大幅提升了智能体在多步执行中的连贯性与鲁棒性。
- 论文地址:
No amount of post-training cleanly fixes weak long-horizon foundations: noisy trajectories compound errors, sparse rewards misassign credit, and conflicting teachers trigger forgetting.
— Rohan Paul (@rohanpaul_ai) August 24, 2026
This paper finds, ff you want agents to stay reliable over long tasks, give them clean… pic.twitter.com/d3ER4tEhCM
其他分享
加权记忆树(Weighted Memory Tree):长时运行智能体的动态记忆管理 — DAIR.AI
- 内容简介:DAIR.AI 介绍了加权记忆树(WMT)记忆架构。该机制将智能体运行过程结构化为任务、子任务与动作层级,并通过动态保留分数进行管理(命中更新增强记忆权重,未选择则逐步衰减)。在 GAIA-Text 基准测试中,结合 Qwen3-8B 等开源模型,该方法不仅使任务得分平均提高 9.97 分,同时将提示词 Token 开销降低了 32.8%。
- 传送门:
Interesting new approach to enable memory in long-running agents.
— DAIR.AI (@dair_ai) August 24, 2026
Weighted Memory Tree organizes execution into tasks, subtasks, and actions, then gives every memory a retention score that moves. Event based updates raise it, selection based decay lowers it.
When a subtask… pic.twitter.com/W6LX9gwMVE



