news

AI日报|DeepSeek发布V4视觉模型;Stripe收购OpenRouter;NVIDIA推出AVO智能体

August 22, 2026
Updated Aug 22
5 min read
deepseek
AI日报|DeepSeek发布V4视觉
openrouter
ripe收购OpenRouter;NVIDI
nvidia
outer;NVIDIA推出AVO智
claude
,性能逼近 Claude Opus-
openai
以蔽之:前 OpenAI CTO M
codex
Code、Codex、Herme
news
AI日报|DeepSeek发布V4视觉模型;Stripe收购OpenRouter;NVIDIA推出AVO智能体
2026-08-22

AI日报|DeepSeek发布V4视觉模型;Stripe收购OpenRouter;NVIDIA推出AVO智能体


模型发布/更新

DeepSeek-V4-Flash-Vision-Exp — DeepSeek (深度求索)

  • 一言以蔽之:DeepSeek 推出首款原生支持图像理解的实验性视觉大模型,API 同步上线。
  • 核心亮点
    • 补齐视觉感知短板,原生支持图片输入,并无缝接入 DeepSeek Harness 智能体运行底座。
    • 纯文本与代码能力与 V4-Flash 正式版持平;在多模态 Agent 评测中实现大幅跃升,性能逼近 Claude Opus-4.8。
    • 拥有 1M 超长上下文与 384K 最大输出长度,API 资费与原版 Flash 完全一致(缓存命中低至 ¥0.05/M Token)。
  • 技术规格:多模态视觉语言模型 / 1M 上下文 / API 现已开放
  • 传送门DeepSeek 官方微信公众号文章

Inkling 与 Inkling Small — Thinking Machines Lab

  • 一言以蔽之:前 OpenAI CTO Mira Murati 创立的实验室推出开源权重多模态 MoE 推理模型。
  • 核心亮点
    • Inkling Small 拥有 276B 总参数、12B 激活参数,原生支持文本、图像与音频输入,具备 1M 上下文窗口。
    • 权重遵循 Apache 2.0 协议完全开源,针对智能体推理与复杂任务规划进行了深度后训练。
    • OpenRouter 现已提供免费托管接口(限定在 Claude Code、Codex、Hermes 等 Agent Harness 内调用)。
  • 技术规格:276B 参数 (12B 激活) / 开源权重 (Apache 2.0) / 1M 上下文 / 原生多模态输入
  • 传送门

Pika Speech — Pika

  • 一言以蔽之:实时率低至 0.02 的 3B 文本转语音(TTS)模型,推理速度与成本表现卓越。
  • 核心亮点
    • 仅需约 1.2 秒即可生成 1 分钟 48 kHz 录音室级高清语音,单次请求最长支持 5 分钟长音频合成。
    • 成本效益比 ElevenLabs v3 高出 9 倍,比 Cartesia 高出 4.5 倍,大幅降低长语音 Agent 的运行成本。
  • 技术规格:3B 参数 / 闭源 API / RTF 0.02 / 48 kHz 高保真
  • 传送门Pika 官方技术博客

Runway Ruby — Runway

  • 一言以蔽之:专为专业影视级后期工作流打造的 SDR 转 16-bit HDR 视频色彩转换模型。
  • 核心亮点
    • 支持将标准动态范围(SDR)视频提升转换为 16-bit EXR 序列帧或 10/12-bit ProRes / HEVC 格式。
    • 原生支持 BT.2020 广色域与 PQ / HLG 高动态范围标准,兼容最长 30 秒的实拍或 AI 生成视频。
  • 技术规格:专业视频色彩重建模型 / 支持 16-bit EXR & ProRes / BT.2020 色域
  • 传送门

混元翻译系列模型 Hy-MT2 — 腾讯混元

  • 一言以蔽之:腾讯混元团队开源覆盖 33 种语言的高质量大模型机器翻译系统。
  • 核心亮点
    • 包含 Hy-MT2-1.8B 紧凑模型与 Hy-MT2-30B-A3B MoE 模型,主打真实场景与专业术语翻译。
    • 具备出色的结构化文本(Markdown、JSON、代码注释)与风格定制指令遵循能力。
    • 已同步上线 OpenRouter 等主流模型路由平台。
  • 技术规格:1.8B Dense & 30B-A3B MoE / 开源 / 支持 33 种语言
  • 传送门

产品发布/更新

Claude Security 集成 Claude Mythos 5 — Anthropic

  • 更新内容:Anthropic 宣布其前沿安全大模型 Claude Mythos 5 正式接入 Claude Security(面向所有 Enterprise 企业客户开启公测)。企业团队无需直接调用模型底层,即可在后台直接利用其进行深度代码漏洞扫描并输出修复补丁,扫描费用按常规 Token 计费。同时推出 3500 万美元的“防御者优势基金(0xDAF)”,资助开源软件的漏洞修复与自动化安全建设。
  • 适用人群:[企业安全架构师 / DevSecOps 工程师 / 开源项目维护者]
  • 体验通道Anthropic 官方博客

GPT-5.6 Sol API 降价 20% 与按密钥用量追踪 — OpenAI

  • 更新内容:OpenAI 宣布 GPT-5.6 Sol 的 API 及 Codex 积分价格在未来 3 个月内下调超 20%。同时在 API Platform 与 Admin API 中上线“按 API Key 追踪用量与支出”功能,企业可在看板中实时分析各应用工作负载的消耗情况,并设置硬性月度支出上限以防意外超支。
  • 适用人群:[AI 应用开发者 / 创业团队架构师 / 成本控制负责人]
  • 体验通道

NVIDIA AVO 自主编程智能体 — NVIDIA

  • 更新内容:NVIDIA 正式公布通用自主编程智能体 NVIDIA AVO(Autonomous Vision Operator)。AVO 融合了长期记忆、工具链调用与自适应执行反馈,在 ARC-AGI-3 交互式推理基准上取得了 100% 满分(通关全部 25 个环境的 183 个关卡),能够在无明确规则与说明的前提下持续自主探索并完成高难度长流程任务。
  • 适用人群:[智能体架构师 / 自动化研发团队 / 前沿 AI 研究人员]
  • 体验通道

Vercel Connect 赋予 v0 连接 100+ 企业服务能力 — Vercel

  • 更新内容:Vercel 推出 Vercel Connect,使 v0 构建的应用和智能体能够安全直连 Slack、GitHub、Salesforce、Google、Notion 等 100 多款主流企业级 SaaS 服务。系统由平台托管应用注册,并自动生成短期 Token 处理身份鉴权,开发者无需手动轮换或管理长期敏感密钥。
  • 适用人群:[全栈开发者 / 独立开发者 / 企业内部工具构建者]
  • 体验通道Vercel 官方更新日志

X Ads 推出 Agent-Native MCP 广告管理接口 — X (Twitter)

  • 更新内容:X Ads 正式推出专属模型上下文协议(MCP)接口,支持 Grok、Claude Code 等 AI 智能体通过自然语言直接管理广告营销全流程。该 MCP 提供 23 个工具,覆盖广告系列创建、精准受众定向与数据追踪;新建广告默认进入暂停状态,需人工确认后激活,有效防止 AI 擅自消耗预算。
  • 适用人群:[出海营销团队 / 广告投放操盘手 / 自动化运营工程师]
  • 体验通道

Firecrawl Developer Index 开发者专用检索索引 — Firecrawl

  • 更新内容:网络抓取平台 Firecrawl 推出专为 Coding Agent 优化的 Developer Index。该索引收录了超过 7000 万个权威源码仓库、官方技术文档和 GitHub Issue,具备极高的编程上下文召回率,可通过 CLI 与 MCP 插件让代码智能体在编写代码时获取最新、最准的开源库依赖信息。
  • 适用人群:[AI 编程工具开发者 / Coding Agent 深度用户]
  • 体验通道

行业动态

Stripe 正式收购多模型聚合路由平台 OpenRouter

  • 事件概述:全球支付巨头 Stripe 宣布收购成立仅三年的知名 AI 模型聚合平台 OpenRouter。虽然具体交易金额未公开,但这成为近年来 AI 基础设施领域推进速度最快的收购案之一。OpenRouter 将保持独立运营,并借助 Stripe 的全球网络加速模型计费与分发能力。
  • 影响分析:Stripe 正在全速布局“智能体经济(Agentic Economy)”的底层支付与结算层。收购坐拥庞大开发者群体与数百种模型分发渠道的 OpenRouter,将帮助 Stripe 牢牢占据 AI 时代的核心流量与 Token 结算入口。
  • 新闻链接

xAI 旗下 Grok 4.6 正式入驻 Google Cloud Vertex AI

  • 事件概述:Google Cloud 宣布与马斯克的 xAI 达成合作,正式将 Grok 4.6 模型引入 Vertex AI 平台。企业客户可以直接利用 Google Cloud 的合规环境、数据加密与 MLOps 工具链调用 Grok 系列模型。
  • 影响分析:云服务巨头多方聚合前沿模型的格局进一步明晰。Grok 4.6 在代码与工程推理基准(如 CursorBench)表现亮眼,登陆 Vertex AI 将显著拓展其在跨国企业与云原生客户中的商业化落地。
  • 新闻链接

SGLang 联合蚂蚁集团发布 Weight Cache Daemon,实现亚秒级重启

  • 事件概述:LMSYS SGLang 团队与蚂蚁 Ling Infra 团队联合发布两项重大推理优化成果:一是推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝将权重加载时间从 495 秒降至 0.63 秒(加速达 785 倍),实现多实例亚秒级容灾切换;二是在 4 块 Blackwell GPU 上优化 Ling-3.0-flash,将投机解码延迟降低 54%。
  • 影响分析:攻克了超大 MoE 模型在线服务中节点故障恢复周期过长的痛点,显著提升了大规模高并发 AI 推理集群的稳定性和吞吐上限。
  • 新闻链接LMSYS 官方博客

论文研究

T-Rex: 触觉感知的灵巧手操作框架与开源数据集 — UC Berkeley & NVIDIA 等

  • 研究动机:现有具身智能中的视觉-语言-动作(VLA)模型大多缺乏触觉反馈,在面对物体盲插、按压弹性形变等微观接触任务时极易失败。
  • 核心创新:提出 T-Rex 框架,将触觉提升为一等公民,采用非对称双时钟 Transformer 架构(慢速视觉规划 + 4 倍高频触觉微调);同时开源了包含 50 小时、5500 个轨迹的超大规模机器人触觉同步数据集。
  • 研究成果:在日常复杂物体的精细抓取与盲插等任务中,大幅提升了灵巧手操作的成功率与抗外界扰动能力。
  • 论文地址项目主页与数据集

EnvHarness: 为智能体学习打造可编程自适应环境 — Google DeepMind 等

  • 研究动机:目前的智能体训练环境大多是静态硬编码的,随着智能体能力增强,固定环境无法持续暴露其新的策略缺陷。
  • 核心创新:提出 EnvHarness 框架,在不修改底层环境逻辑的前提下为其包裹一层可编程插件;配套的 EnvRigger 将智能体策略视为黑盒,分析其执行轨迹并自动合成针对弱点的对抗性训练组件。
  • 研究成果:在 4 个领域的 5 项主流基准测试中,智能体泛化得分最高提升 9.0 分,同时执行步数减少 9.8%。
  • 论文地址arXiv:2608.19880

其他分享

Anthropic 发布《AI 原生 SDLC 实战手册》

  • 内容简介:Anthropic 官方发布指南,系统拆解如何用 Claude 重构软件开发生命周期(SDLC)。手册指出当代码生成不再是瓶颈后,规划与审查成为新约束,建议团队通过 intent.md 固化需求,将工程规范编码为 Agent Skills,并用持续自动化评测代替传统流程关卡。
  • 传送门Anthropic 官方实战手册

Notion 推出 Local Agents 技能导出功能

  • 内容简介:Notion 现已支持将工作区内的知识库与工作流规范一键导出为标准的 SKILL.md 格式,直接分发给 Claude Code、Codex、Cursor、Gemini 或 Grok 等本地代码智能体,实现团队知识资产与本地开发环境的无缝流转。
  • 传送门

is-agentic:评估网站对 AI Agent 友好度的开源审计工具

  • 内容简介:由 Vercel 开发者与 Ora 团队联合推出的开源工具,内置 100 多项自动化检查标准,可全面评估网站对 AI 智能体读取与操作的友好程度,并提供一键式修复 Prompt 与 Agent 专用 CLI。
  • 传送门is-agentic 体验网址
分享到:
Featured Partners

© 2026 Communeify. All rights reserved.