AI日报|Gemini 3.7 Flash发布、Qwen3.8与GLM-5.3双重重磅更新、SpaceX完成收购Cursor
模型发布/更新
Gemini 3.7 Flash — Google
- 一言以蔽之:谷歌推出全新 Gemini 3.7 Flash 模型,主打极速智能体与代码生成能力,并提供半价优惠。
- 核心亮点:
- 在软件工程、Web 开发与复杂知识工作等任务中表现显著提升,大幅增强了多步骤智能体工作流的推理与准确度。
- 即日起至年底推出 50% 价格折扣(输入 $0.75/M Token,输出 $3.75/M Token),并已全面接入 Gemini API、AI Studio 与 Google Workspace。
- 技术规格:闭源 API / 1M Context / 原生多模态 / 智能体 & 编程强化
- 传送门:Google 官方博客
Qwen3.8 系列 (Qwen3.8-27B & Qwen3.8-2.4T-A95B) — 阿里通义千问 (Alibaba Qwen)
- 一言以蔽之:通义千问开源 Qwen3.8 旗舰级 MoE 模型(2.4T 参数)与端侧 27B 稠密多模态模型,全面采用 Apache 2.0 协议。
- 核心亮点:
- Qwen3.8-27B 仅 27B 参数,在真实代码生成与办公工作流中全面超越前代 Qwen3.7-Plus,且支持在消费级单卡(如 RTX 5090)或 MacBook 上顺畅运行。
- 旗舰款 Qwen3.8-2.4T-A95B 具备 2.4 万亿总参数(95B 激活参数),原生支持 262K 上下文(可扩展至 1M),专门针对自主智能体与长流程深度研究进行了强化。
- 技术规格:开源 (Apache 2.0) / 27B 稠密多模态 & 2.4T MoE / 262K-1M Context
- 传送门:Hugging Face 仓库
GLM-5.3 — 智谱 AI (Z.ai)
- 一言以蔽之:智谱 AI 发布 GLM-5.3,基于 743B 基座进行大规模后训练,主打前沿编程与涌现的网络安全防御能力。
- 核心亮点:
- 与 GLM-5.2 共用同一个基座模型,通过数十倍长程任务环境的后训练 Scaling,编程体验提升 50%,在 Terminal Bench 3.0 等公开基准中荣登开源第一。
- 在后训练中涌现出强悍的网络安全防护与白盒代码审计能力,在 CyberGym 基准中取得 84.5% 高分,持平 Mythos 5 与 GPT-5.6 Sol。
- 模型权重将在完成安全加固后于两周内正式开源。
- 技术规格:743B 架构 / 开放权重 (两周内开源) / 后训练 Scaling 强化
- 传送门:Z.ai 官方博客
Pika Audio Models — Pika
- 一言以蔽之:Pika 推出四大前沿音频基础模型,大幅降低专业生成音效与配音的推理成本。
- 核心亮点:
- 包含 Soundtrack(视频对齐配音)、Music(音乐生成)、SFX(音效生成)和 Speech(语音合成)四款专用基础模型。
- 采用团队最新的高效推理技术,综合生成成本相比市场上同类模型降低最高达 20 倍。
- 技术规格:闭源 API / 4 大专用音频架构 / 高性价比推理
- 传送门:Pika 技术官方文章
DeepSeek-V4-Pro-0813 — DeepSeek (深度求索)
- 一言以蔽之:DeepSeek 推出 DeepSeek-V4-Pro-0813 模型,专为复杂智能体与代码工具工作流打造。
- 核心亮点:
- 原生支持 1M Token 上下文窗口,并提供低、高、最大三档推理强度配置。
- 在 Terminal Bench 2.1、DeepSWE 等智能体基准测试中超越 Claude Opus 4.8,性价比极高。
- 技术规格:开放 API (MIT 协议) / 1M Context / 可调推理强度
- 传送门:
This time, it’s official. DeepSeek V4 Pro just landed. 🚀@deepseek_ai DeepSeek-V4-Pro-0813 is now live on SiliconFlow with Day-0 support — with more room to think, build, and ship.
— SiliconFlow (@SiliconFlowAI) August 14, 2026
🧠 1M context
⚙️ low / high / max reasoning
🛠️ More focus on coding, tool use & agent workflows… pic.twitter.com/Snla5OTaXw
MAGI-2 Preview — SandAI
- 一言以蔽之:SandAI 开源 114B 参数视音频混合专家(AV MoE)视频生成模型 MAGI-2 预览版。
- 核心亮点:
- 采用 1140 亿参数的视音频联合混合专家架构,大幅提升多模态视频生成的扩展效率。
- 代码与模型权重已同步上架 GitHub 与 Hugging Face,方便社区部署体验。
- 技术规格:开源权重 / 114B AV MoE 架构 / 视频+音频联合生成
- 传送门:GitHub 代码仓库
产品发布/更新
GPT-5.6 Sol Ultrafast 模式 — OpenAI
- 更新内容:OpenAI 联合 Cerebras 推出 GPT-5.6 Sol Ultrafast 极速模式预览。基于 Cerebras 晶圆级巨型芯片(Wafer-Scale Engine)的算力加速,该模式能提供高达 14 倍的推理速度提升,率先面向 API 核心企业客户开放,以解决高并发与实时交互场景下的延迟痛点。
- 适用人群:[企业级 AI 开发者 / 实时交互应用架构师]
- 体验通道:OpenAI 官方公告
Claude Code Auto 模式与 Token 优化指南 — Anthropic
- 更新内容:Claude Code 宣布向 Pro、Max 及 Team 用户默认开启 Auto 权限模式,并同步发布官方 Token 成本优化指导。Auto 模式引入独立的 Shell 命令安全分类器,测试显示可捕获 89% 的危险命令(手动审批仅 14%)。官方技巧指出:善用
@-mention引用文件、使用/clear及时清理无用上下文,并充分利用 Prompt Caching(读取成本仅为原输入的 0.1 倍),可显著降低会话成本。 - 适用人群:[全栈开发者 / AI 辅助编程用户]
- 体验通道:Anthropic 官方博客
开源全同态加密编译器 HEIR — Google
- 更新内容:谷歌开源全同态加密(HE)编译器 HEIR,推动密码学级别的私有 AI 推理走向实用。HEIR 能将预训练 AI 模型直接转换为可处理加密输入的代码,实现数据在整个推理过程中无需解密。目前已在推荐系统、欺诈检测与热词识别中成功验证,并与硬件厂商合作进一步降低计算开销。
- 适用人群:[隐私计算研究员 / 金融与安全领域 AI 工程师]
- 体验通道:Google 官方安全博客
Claude 文本水印检测 API — Anthropic
- 更新内容:Anthropic 宣布推出文本水印检测 API。该技术基于 Google DeepMind 的 SynthID-Text 变体,通过在选词生成时嵌入不易察觉的统计模式,方便第三方识别文本是否由 Claude 生成。水印不改变文本表达质量或创造力,且不增加 Token 成本,符合欧盟《AI 法案》的合规要求。
- 适用人群:[内容审核平台 / 教育机构 / 合规审查人员]
- 体验通道:Anthropic 官方新闻
行业动态
SpaceX 正式完成对 Cursor (Anysphere) 的收购
- 事件概述:AI 编程工具 Cursor 的母公司 Anysphere 正式宣布被 SpaceX 完成收购。收购完成后,Cursor 团队将加入 SpaceXAI 部门,共同推进 Grok 架构在软件工程与知识工作领域的应用,并共享全球顶尖的超级计算集群算力。
- 影响分析:算力巨头与顶级 AI 终端产品的深度结合,预示着未来的 AI 编程编辑器将直接建立在定制化模型与庞大底层基础设施之上,进一步降低研发与调用成本。
- 新闻链接:Cursor 官方博客
OpenAI 年化收入突破 400 亿美元,Anthropic 洽谈 60 亿美元收购 Decart
- 事件概述:据彭博社报道,OpenAI 的年化运行率收入(ARR)已突破 400 亿美元,较此前翻倍;与此同时,Anthropic 被曝正洽谈以约 60 亿美元收购芯片效率优化软件初创公司 Decart AI,旨在进一步优化其庞大算力集群的训练与推理效率。
- 影响分析:前沿 AI 实验室在收入高速增长的同时,正通过基础设施维度的重组与大规模并购,将竞争焦点从单纯的模型能力扩展至底层硬件与推理加速环节。
- 新闻链接:
Bloomberg reports OpenAI's annualized revenue has topped $40B, roughly doubling its prior run rate.
— Rohan Paul (@rohanpaul_ai) August 14, 2026
the pace rose more than 20% month over month in July, with coding software, subscriptions and ads helping drive growth.
And then Anthropic says its own run-rate revenue crossed… pic.twitter.com/B6pj9TBa6u
论文研究
Faraday 27B:基于 Replica 框架的科学研究复现智能体 — AI Research Group
- 研究动机:解决前沿 AI 模型在长流程科学推理与复杂科研代码复现中缺乏自我驱动与鲁棒性的难题。
- 核心创新:提出 Replica 强化学习框架,将科研复现转化为可量化的任务空间,并训练出 27B 参数的 Faraday 智能体。该智能体采用“科学指导+工具派发”的双层工作流,自动调用底层编程智能体。
- 研究成果:在 68 个未见的 AI-for-science 任务中取得 0.791 得分,在 held-out 论文复现基准上超越了 Claude Opus 4.8(0.748)与 GPT-5.5(0.729)。
- 论文地址:ArXiv 论文
Wiggle 评估框架:大模型作为裁判 (LLM-as-a-Judge) 的抗压测试 — Meta AI
- 研究动机:评估作为裁判的大语言模型(LLM)在遭遇质疑、重新提示或对抗性说服时,其判罚裁决的稳定性与准确度。
- 核心创新:提出 Wiggle 框架,对 9 个前沿模型在 14 项评估任务中施加单次质疑与持续说服压力,测试其裁决耐久度。
- 研究成果:研究发现所有模型均存在显著的“动摇(Wiggle)”现象,在对抗说服下裁决翻转率高达 62% 至 91%,且说服导致的翻转绝大多数偏离了真实 Ground Truth。
- 论文地址:ArXiv 论文
其他分享
吴恩达发布《AI 工程核心技能全景图》
- 内容简介:AI 领域知名学者吴恩达(Andrew Ng)梳理并发布了当前 AI 工程(AI Engineering)领域最关键的技能全景图,全面涵盖提示词工程、RAG 检索增强、智能体编排、模型微调与部署评估等技术体系。
- 传送门:
New: A map of the most important skills in AI Engineering. https://t.co/VVkn1Dqp1N
— Andrew Ng (@AndrewYNg) August 14, 2026
别分类,去“幻觉”!用向量嵌入实现精确博文打标签
- 内容简介:开发者 Simon Willison 分享了一种高效打标签的新思路:当候选标签库过大无法一次性放入 Prompt 时,先让模型自由“幻觉”出最贴切的分类,再通过向量嵌入在已有标签库中进行语义最近邻匹配,完美兼顾灵活性与分类规范性。
- 传送门:Simon Willison 个人博客



