AI日报|Claude Opus 5.5 与 GPT-6 Sol/Luna 掀起降价风暴,小米开源万亿参数 MiMo-V2.6
模型发布/更新
Claude Opus 5.5 — Anthropic
- 一言以蔽之:Claude 5.5 系列首发旗舰登场,以低 40% 的运行成本和 30% 以上的提速,达到并超越 Fable 5.1 水平。
- 核心亮点:
- 推理与响应全面提速:输出速度提升超 30%,在实际长程代码重构与智能体任务中消耗 Token 更少,典型任务总体成本下降约 40%。
- 大幅降低缓存读取价格:缓存读取单价下调 60% 至 $0.20/M tokens,极大降低长上下文智能体与代码审计工作流的成本。
- 表达精炼直击重点:改善了前代冗长行话问题,重要结论前置;全面适配自适应思考(Adaptive Thinking)并退役强制工具调用模式。
- 技术规格:闭源商业 API / 1M 上下文 / 登顶 Artificial Analysis Intelligence Index(58 分)
- 传送门:Anthropic 官方博客
GPT-6 Sol 与 GPT-6 Luna — OpenAI
- 一言以蔽之:OpenAI 全面下放 Astra 旗舰级技术成果,以减半的 API 价格推出面向企业工作流与海量调用场景的 Sol 与 Luna。
- 核心亮点:
- API 价格直接腰斩:定价较 GPT-5.6 优惠价再降 50%(Sol 输入 $2/M、输出 $10/M;Luna 输入 $0.10/M、输出 $0.50/M)。
- 继承 Astra 核心能力:在长任务代码评测 DeepSWE 与企业流程自动化基准 AutomationBench 中表现优异,语言表达更直观清晰。
- 全平台即刻推送:API、Codex、ChatGPT Work 以及桌面端即日起向付费与免费用户分批开放。
- 技术规格:闭源商业 API / 支持可调节推理强度 / 多项长程智能体基准大幅跃升
- 传送门:OpenAI 官方博客
MiMo-V2.6 系列 (Pro & Flash) — 小米 (Xiaomi MiMo)
- 一言以蔽之:小米开源业界迄今最大规模强化学习训练的原生多模态模型家族,以极致成本效益登顶开源智能指数榜首。
- 核心亮点:
- 超大规模 MixRL 训练:覆盖 75 万条超长智能体轨迹(单条 11-15 万 Token),通过混合多领域 RL 训练实现从工具调用、代码重构到自我纠错的闭环。
- 全栈开源生态:基于 MIT 协议完全开源权重,并同步开放 7000+ 强化学习任务环境、端到端 RL 训练框架以及蒸馏版 Qwen-9B 小模型。
- 极致部署与调用性价比:Pro 版 API 定价低至输入 $0.435/M、输出 $0.87/M(99% 缓存折扣),Flash 版成本仅为海外同级模型数十分之一。
- 技术规格:1.02T 总参数(42B 激活)MoE 架构 / 1M 上下文 / MIT 开源协议
- 传送门:MiMo 官方发布文档
Grok 4.7 — SpaceXAI (xAI)
- 一言以蔽之:参数规模提升至 2.1 万亿,在维持同等价格与推理速度的前提下大幅强化长时间编码与长程工具调用能力。
- 核心亮点:
- 长程推理与构建能力升级:在 CursorBench 达到 46.3%,EEBench 达到 64%,可稳定支持复杂跨文件应用构建与 3D 开放世界模拟生成。
- 加量不加价:保持输入 $2/M、输出 $6/M 定价不变,上下文窗口支持 50 万 Token。
- 技术规格:2.1T 参数 / 500K 上下文 / 已上线 Cursor、Grok Build 与 API
- 传送门:xAI 官方公告
Ming-Image-0.1-Design 家族 — 蚂蚁集团 (AntLing)
- 一言以蔽之:蚂蚁开源 6B 级专业 UI/UX 设计生成与分层编辑模型,登顶开源设计类榜单第一。
- 核心亮点:
- 专业分层与可编辑性:推出 Design 与 Design-Layer 两款检查点,原生支持分层图层输出与图片一键转换为可编辑 PPT。
- 开源设计智能体技能:配套开源 Ling UI Design Skill 与 Image-to-Editable-PPT Skill 两套 Agent 工具包。
- 技术规格:6B 参数 / 开源权重 / 登顶 Artificial Analysis UI/UX Design 开源榜首
- 传送门:Hugging Face 模型主页
混元生图 3.5 预览版 (Hy Image3.5 preview) — 腾讯混元
- 一言以蔽之:腾讯发布专业级高性价比生图模型,单张 2K 分辨率生成价格低至 0.15 元。
- 核心亮点:
- 画质与文字渲染升级:综合能力较 3.0 提升约 30%,在多轮对话连续编辑与精准中英文字体排版上表现优异。
- 极致商业性价比:腾讯云 API 2K 输出定价仅 0.15 元/张,且仅对输出成功图像计费。
- 技术规格:预览版 / 单次最多支持 5 张参考图 / 最高 2K 分辨率输出
- 传送门:腾讯混元官方公告
产品发布/更新
GPT-6 提示词缓存与诊断系统 — OpenAI
- 更新内容:为 GPT-6 API 推出全新提示词缓存机制。合格前缀复用可享最高 90% 折扣,支持开发者自定义显式断点;在调整推理强度或开关工具时可继续保持缓存有效,并上线了全新缓存命中率仪表盘与诊断 API。
- 适用人群:[开发者 / 智能体架构师 / 企业级 API 用户]
- 体验通道:OpenAI 提示词缓存文档
Kimi 浏览器扩展 (Kimi Browser Extension) — 月之暗面 (Moonshot AI)
- 更新内容:原 Kimi WebBridge 全新更名升级。用户可在浏览器侧边栏与 Kimi 交互,直接驱动其操作网页、提取信息、填写表单;支持将单次网页操作录制并封装为可复用的专属“智能体技能 (Skill)”。
- 适用人群:[办公族 / 运营与市场人员 / 效率工具爱好者]
- 体验通道:Kimi 浏览器扩展页面
Swap Anything & Relight Media — Pika
- 更新内容:全新 Pika 平台上线两项视频编辑工具:“Swap Anything”支持在保留原视频动作节奏与运镜的前提下任意替换角色、道具及场景;“Relight Media”可精准重构画面光影布局与氛围。
- 适用人群:[视频剪辑师 / 影视特效从业者 / 内容创作者]
- 体验通道:Pika Swap Anything 体验页
Scribe v2 Medical — ElevenLabs
- 更新内容:专为临床医疗场景微调的语音转文本模型,词错误率 (WER) 较基础版降低 18%,大幅提升对复杂药品名称、解剖学与病理学术语的识别准确率;符合 HIPAA 标准并提供零保留隐私模式。
- 适用人群:[医疗健康从业者 / 电子病历开发团队 / 临床录音转录员]
- 体验通道:ElevenLabs Scribe Medical
Worker Previews — Cloudflare
- 更新内容:推出基于 Git 分支的生产级隔离预览环境。每个分支均拥有独立的运行环境、变量、密钥及绑定资源,使自动化编码智能体能够在不污染生产环境、不减速开发流的前提下完成闭环测试。
- 适用人群:[全栈开发者 / 自动化智能体研发团队 / DevOps 工程师]
- 体验通道:Cloudflare 官方博客
行业动态
美国政府明确否决 AI 实验室“责任豁免”诉求,贝森特或任 AI 事务主管
- 事件概述:美国财政部长贝森特 (Scott Bessent) 在公开采访中表态,政府不会为 AI 实验室提供联邦责任豁免,强调“应当对产品负责的是人与企业,而非技术本身”;同时据 Semafor 报道,贝森特正成为特朗普政府新设“AI 事务主管 (AI Czar)”的主要候选人。
- 影响分析:明确了“谁制造、谁负责”的监管基调,给试图以超级智能安全为由争取法律免责的前沿实验室敲响警钟,也将直接影响大模型企业的上市合规与法律风险披露。
- 新闻链接:
Firecrawl 完成 7,500 万美元 B 轮融资,推出智能体知识库 Alexandria
- 事件概述:网页数据提取平台 Firecrawl 宣布完成由 Smash Capital 领投的 7,500 万美元 B 轮融资,并推出面向 AI 智能体的实时知识库 Alexandria,支持智能体即时检索实时网络、专业数据供应商及学术政府档案,同时向数据提供者提供分成。
- 影响分析:标志着数据抓取基础设施正从单一的“网页清洗转换”向“智能体即时知识消费与数据创作者分润机制”演进,重构智能体时代的数据供给链。
- 新闻链接:Firecrawl 官方博客
Epoch AI 深度报告:同等性能 AI 成本每季度骤降 47%
- 事件概述:知名研究机构 Epoch AI 发布研报指出,过去三年间达到同等 AI 性能的推理成本平均每季度下降约 47%(年降幅约 13 倍),降价速度远超历史上 DNA 测序、锂电池及电力等变革性技术。
- 影响分析:揭示了大模型巨头近期激烈价格战的底层技术推力;随着推理边际成本趋近于零,高频智能体调用的大规模商业落地正在迎来经济可行性拐点。
- 新闻链接:Epoch AI 研报全文
论文研究
DualSQL: Multi-Agent RL for Text-to-SQL — Google 研究团队
- 研究动机:复杂 Text-to-SQL 任务对数据库模式解析与 SQL 生成的双重逻辑要求极高,传统单模型方法容易出现推理幻觉或多智能体强化学习崩溃。
- 核心创新:提出 DualSQL 框架,将任务拆分为“模式链接智能体”与“SQL 编写智能体”,两角色共享同一组模型权重并在单一强化学习流中协同训练,同时引入稳健的执行匹配奖励函数。
- 研究成果:仅使用 3,755 条训练样本,DualSQL-4B 在 BIRD 验证集上即取得 68.0% 的执行准确率,媲美以往 7B 模型;8B 版本达到 71.1%,超越以往 32B 单模型系统。
- 论文地址:ArXiv 论文链接
Hint-Guided Self-Distillation for Agent Error Correction — Perplexity AI
- 研究动机:计算机操作智能体在面对复杂长链路界面与工具调用时,常因早期小失误导致后续任务全盘失败。
- 核心创新:提出提示引导的自蒸馏后训练机制(Hint-guided Self-distillation),使模型在后训练阶段主动消化过往错误经验,在推理时不依赖任何外生提示即可纠偏。
- 研究成果:在真实线上 A/B 测试中,经过自蒸馏训练的模型检查点将生产环境中的工具调用失败率相对降低了 21.2%。
- 论文地址:Perplexity 技术博客
其他分享
Kev: 基于 Qwen3.5 的本地化轻量 Jev 决策模型族
- 内容简介:社区开源了一套遵循 Jev 架构的轻量级决策模型族(提供 0.8B、4B、9B 规格),基于 Qwen3.5 构建且采用 Apache-2.0 协议开源。9B 版本仅需 32GB 统一内存 Mac 即可在 BF16 下流畅运行,完全兼容 TypeSafe API,可直接用作本地 LLM-as-a-Judge 或高频业务分支决策器。
- 传送门:GitHub 代码库
LiteParse v2.14.6: 极速开源 PDF 转 Markdown 解析器
- 内容简介:LlamaIndex 发布 LiteParse v2.14.6 更新,针对底层自维护 PDFium 进行内存分配与内核优化,将纯文本 PDF 的单页解析耗时压低至 2.8ms,解析速度比目前主流本地解析器快 1.5 倍,支持 Python、Node.js、Rust 及浏览器端原生运行。
- 传送门:GitHub 代码库

