AI日报|Google 发布 Gemini 3.8 实时语音大模型;豆包大模型 2.1 Pro 升级 Agent 与多模态能力
模型发布/更新
Gemini 3.8 Live 与 Extended Thinking — Google DeepMind
- 一言以蔽之:Google 官方发布 Gemini 3.8 实时语音系列模型,并推出支持后台异步思考与多步骤推理的 Extended Thinking 版本。
- 核心亮点:
- 实时思考与发音同步:Extended Thinking 版本在面对复杂任务时能够自然过渡并实时汇报后台推理进度(如自然说出“让我查一下…”),提供如真人通话般的流畅并发交互体验。
- 多模态与多语言增强:支持 97 种语言的自动平滑过渡,并具备近实时多模态视觉理解能力,可用于实时棋盘对弈、管道检修及视觉辅助交互。
- 技术规格:语音到语音(Speech-to-Speech)大模型 / 闭源 / 夺得 Speech-to-Speech 综合榜单前列
- 传送门:Google 官方博客
豆包大模型 2.1 Pro (0915 版本) — 字节跳动 / 火山引擎
- 一言以蔽之:豆包大模型 2.1 Pro 发布 0915 版本更新,全面强化多步骤 Agent 任务交付、看图写代码与视频多模态推理能力。
- 核心亮点:
- 深度 Agent 交叉验证:在金融投研等复杂场景中,模型能够自主调度数百个子 Agent、检索千余个网页并进行多源交叉验证,大幅减少幻觉,产出接近人类分析师水平的底稿。
- 多模态代码还原:支持直接读取设计稿、图纸及操作录屏,精准还原并生成可运行的代码;图像与视频推理的 Token 消耗较上一代降低 30% 以上。
- 技术规格:闭源商业大模型 / 支持火山方舟 API / 提供版本锁定与动态演进入口
- 传送门:火山方舟平台
Jev (System One 模型) — TypeSafe AI
- 一言以蔽之:由 ChatGPT 联合发明人 Diogo Almeida 创办的 TypeSafe AI 推出全新类别模型 Jev,专注于以极低延迟和成本在软件内部执行类型安全的概率决策。
- 核心亮点:
- 放弃文本生成,专注决策路由:Jev 完全放弃了传统的逐个 Token 文本生成,采用并行采样机制,输入非结构化数据后直接输出带校准概率的结构化决策结果(选择、评分、布尔值)。
- 极致的速度与经济性:响应速度达 70 到 500 毫秒,输入 Token 价格低至 0.042 美元/百万 Token,输出免费,速度与性价比较传统大模型提升数十到数百倍。
- 技术规格:System One 概率决策模型 / 闭源 / 支持 AI SDK 实验性 evaluate API
- 传送门:TypeSafe AI 官方博客
Koa 企业智能体模型 — Salesforce
- 一言以蔽之:Salesforce 基于开源 Nemotron-3-Super-120B 推出专为企业工作流定制的智能体模型 Koa。
- 核心亮点:
- 声明式配置微调:利用 Salesforce 的 Agent Script 声明式文件扩展为多轮任务进行 GRPO 强化学习训练,显著提升函数调用准确率。
- 垂直领域卓越表现:在 CRM Bench 上的表现逼近顶级前沿闭源模型,完美契合企业级复杂流程自动化需求。
- 技术规格:企业级定制模型 / 基于 Nemotron-3 架构 / GRPO 强化学习训练
- 传送门:arXiv:2609.15066
产品发布/更新
Mistral 与 Mozilla 战略合作 — Mistral AI & Mozilla
- 更新内容:Mistral AI 宣布与 Mozilla 达成官方战略合作,将开源权重模型与隐私优先的网页浏览生态深度整合,为用户在网页端使用 AI 时提供更多隐私保护、控制权与技术选择。
- 适用人群:[开源模型开发者 / 隐私注重型用户 / 浏览器用户]
- 体验通道:Mistral AI 官方博客
Grok Bot 工作流指南与记忆功能 — xAI
- 更新内容:xAI 正式公开 Grok Bot 在工程、客服、GTM、产品和设计等领域的实际工作流指南与模板。同时 Grok Build 上线记忆功能,可在后台跨会话自动记录项目约定与决策,助力开发者打造高效的 AI 团队协作流。
- 适用人群:[AI 开发者 / 智能体架构师 / xAI 生态用户]
- 体验通道:xAI 官方指南
Specs Intelligence AI 助手 — Snap
- 更新内容:Snap 正式推出连接 Gmail、Slack 等账号的主动式 AI 助手 Specs Intelligence,可提供会议决策提示与行程安排。该服务首发登陆 iOS 预览版,Mac 版开放等待名单,并与 Snap 的 AR 眼镜 Specs 同步联动。
- 适用人群:[移动端办公族 / AR 眼镜用户 / 效率工具爱好者]
- 体验通道:The Verge 详细报道
Paid Media Agent — LangChain
- 更新内容:LangChain 推出深度集成于 Slack 的 Paid Media Agent。该智能体能够每周自动读取来自 6 个主流广告平台及数据仓库的消费、点击与转化数据,主动向团队汇报波动原因、提出优化方案并在获得批准后自动执行。
- 适用人群:[营销人员 / 增长工程师 / 广告主 / 智能体开发者]
- 体验通道:LangChain 博客
行业动态
Arcee.ai 完成 B 轮融资,估值突破 10 亿美元
- 事件概述:开源大模型基础设施初创公司 Arcee.ai 宣布完成 B 轮融资,公司估值正式超过 10 亿美元,晋升独角兽行列。此轮融资将加速其下一代 Trinity 模型的跨基础设施扩展,并深化与美国国家实验室及企业客户的合作。
- 影响分析:彰显了开源大模型生态在商业化落地与资本市场上强劲的增长势头,标志着开源权重平台正加速构建成熟的商业护城河。
- 新闻链接:
NVIDIA 推出 CUDA Rust,支持用 Rust 原生编写 GPU 核心代码
- 事件概述:NVIDIA 正式宣布全面押注 Rust 原生 GPU 编程,推出 CUDA Rust 并规划至 2027 年及以后。该方案提供
cuda-oxide(SIMT 路线)与cutile-rs(Tile 路线)两条路径,允许开发者直接用稳定的 Rust 编写 GPU kernel 并编译为 PTX。 - 影响分析:打破了 GPU 编程长期被 C/C++ 垄断的局面,大幅提升了高性能计算与底层 AI 算子开发的内存安全与代码生产力。
- 新闻链接:NVIDIA 开发者博客
论文研究
The Last AI Built by Humans — 字节跳动、清华大学、上海 AI 实验室等 30+ 机构
- 研究动机:面对 AI 快速迭代的浪潮,学术界和工业界亟需一套系统化框架来衡量和评估 AI 自我改进(Self-Improvement)的技术演进阶段与潜在风险。
- 核心创新:联合研究团队发布了一篇长达 75 页的重磅论文,首次将 AI 自我改进能力划分为从 Level 1(人类决定改进方向)到 Level 5(AI 自行改写下一代 AI 的研发过程)的五级阶梯,并对 491 篇现有论文进行了分类梳理。
- 研究成果:发现当前 75% 的研究仍停留在 Level 1-2,达到 Level 5 的不足 6%,为评估前沿模型的自主递归演进风险提供了重要的理论标尺。
- 论文地址:arXiv:2609.11873
多智能体系统中模型选择策略研究 (Mo-Model-Routing) — NVIDIA Research
- 研究动机:在构建多智能体系统(Multi-Agent Systems)时,如何从众多不同能力和规模的开源模型中进行组合与路由,缺乏科学的评估与指导原则。
- 核心创新:NVIDIA 研究人员对 8 种不同的模型选择策略进行了严密测试,涵盖规模、准确率、答案多样性及错误多样性,对比了路由、多数投票和 LLM-as-judge 等架构。
- 研究成果:实验表明,盲目混合不同模型往往会导致性能低于最佳单模型,而采用单一模型家族构建多版本组合或多数投票(如将 HLE 准确率从 29.4% 提升至 32.2%)能带来更稳健的收益。
- 论文地址:arXiv:2609.17306
其他分享
pelmet:macOS 27 专用的原生菜单栏图标管理工具
- 内容简介:一款针对 macOS 27 设计的原生轻量菜单栏管理工具。它直接驱动系统自带的隐藏机制收起多余图标并优雅重排菜单栏,界面精美且无多余后台开销。
- 传送门:GitHub 开源仓库

