AI日报|Google 发布 Gemini 3.8 Flash 系列;Meta 推出 Muse Spark 1.3;阿里通义千问 Qwen3.8-Max-0902 登顶 Code Arena
模型发布/更新
Gemini 3.8 Flash 与 3.8 Flash Cyber — Google DeepMind
- 一言以蔽之:Google 仅隔三周再次闪电推出 Gemini 3.8 Flash,并在复杂推理、自主工程与网络安全防御(Cyber 变体)上取得跨越式突破。
- 核心亮点:
- 3.8 Flash:在 DeepSWE v1.1 软件工程基准上取得 73.7% 得分,逼近 Claude Opus 5(74%);在 Gray Swan 提示词注入(Prompt Injection)防御评测中被攻破率仅 5.5%,展现出极高的智能体安全鲁棒性。
- 3.8 Flash Cyber:专为网络安全防御微调的前沿变体,在 CyberGym 行业基准中达到 86.2%,CWE-Bench 补丁生成达 47.2%,内部实测漏洞发现成功率超 70%。
- 技术规格:1M 上下文窗口 / 多档思考层级(Thinking Levels)/ 维持 Flash 级高性价比
- 传送门:Google 官方博客
Muse Spark 1.3 — Meta
- 一言以蔽之:Meta 发布五个月内的第四个 Muse Spark 版本,主打长程智能体与复杂编码任务,性能直逼闭源顶尖模型。
- 核心亮点:
- 在 Artificial Analysis Intelligence Index 中取得 61 至 62 分,逼近 Claude Fable 5 和 GPT-5.6 Sol,跻身前沿梯队。
- 针对长时程工作流进行了深度优化,相比 1.2 版本实现减少约 20% 工具调用与 25% Token 消耗,Contributor 档位输入 0.10 美元 / 输出 0.20 美元每百万 Token。
- 技术规格:1M 上下文 / 支持文本、图像与 PDF 多模态输入 / 超低推理成本
- 传送门:Meta 开发者中心
Qwen3.8-Max-0902 — 阿里通义千问 (Alibaba Qwen)
- 一言以蔽之:阿里通义千问发布重磅升级模型 Qwen3.8-Max-0902,以 1,691 分直接登顶 Code Arena: WebDev 总榜第一。
- 核心亮点:
- 拥有 2.4T 参数和 1M 上下文,在复杂企业任务、科研长流程及智能体协同(Cowork)任务上进一步后训练调优,全面超越 Claude Opus 5 与 Kimi K3。
- 综合定价仅 5 美元 / 百万 Token(输入 2 美元 / 输出 6 美元,显式命中缓存仅 0.17 美元),以绝对优势领跑 Pareto 效率前沿。
- 技术规格:2.4T 混合专家架构 / 1M 上下文 / Code Arena 榜首
- 传送门:
🚀Qwen3.8-Max just got upgraded. Meet Qwen3.8-Max-0902!
— Qwen (@Alibaba_Qwen) September 2, 2026
2.4T parameters. 1M context tokens. Built for real world complexity.
Further post trained on Coding & Cowork, Qwen3.8-Max-0902 now delivers stronger performance across complex enterprise tasks, scientific research, and… pic.twitter.com/1dNQwl52zJ
产品发布/更新
Cursor 推出 Self-Hosted Machines — Cursor
- 更新内容:Cursor 宣布推出自托管机器(Self-Hosted Machines)功能。允许企业将云端智能体(Cloud Agents)的工具执行环节部署在企业自建基础设施或 VPC 内(兼容 AWS Lambda、Coder、Cloudflare、Daytona、Modal 等沙箱),而规划与推理循环保持在 Cursor 云端,兼顾数据合规与私网资源访问。
- 适用人群:[企业研发团队 / 隐私敏感型开发者 / DevOps 工程师]
- 体验通道:Cursor 官方博客
Claude 原生支持后台电脑操作 (Background Computer Use) — Anthropic
- 更新内容:Anthropic 在 macOS 桌面端为 Claude Cowork 和 Claude Code 推出后台电脑操作功能(Beta)。用户分配任务后,Claude 能够在后台自主点击、输入与调用本地应用,不再独占用户屏幕,且每次初次访问应用均需用户确认授权。
- 适用人群:[重度自动化办公用户 / Claude Pro 与 Max 订阅者 / 开发者]
- 体验通道:
Claude can now use your computer in the background in Claude Cowork and Claude Code.
— Claude (@claudeai) September 2, 2026
Give it something to do on your desktop and Claude clicks, types, and opens apps just like you would, while you work on something else. pic.twitter.com/AOiup03pQK
Lily 本地推理引擎开源 — Perplexity
- 更新内容:Perplexity 正式开源专为 Apple Silicon 架构优化的本地推理引擎 Lily。该引擎针对 Qwen3.6-35B-A3B 进行了深度底层硬件映射,相比 MLX-LM 实现 Prefill 吞吐提升 1.23 倍、Decode 吞吐提升 1.35 倍,为 Mac 端的混合计算提供低延迟底座。
- 适用人群:[Apple Silicon 开发者 / 本地 AI 部署极客 / 端侧推理工程师]
- 体验通道:
Today we’re open-sourcing Lily, the local inference engine we built for hybrid compute in Perplexity Computer.
— Perplexity (@perplexity_ai) September 2, 2026
Lily is specialized for Qwen3.6-35B-A3B on Apple silicon, built so on-device compute doesn’t bottleneck Computer tasks.
Read more: https://t.co/OnowTP3ql6
Mantis: 漏洞自动化挖掘与修复 Harness — Google Cloud
- 更新内容:Google Cloud 开源了其内部使用的漏洞自愈 Harness 框架 Mantis。该系统结合 Critic 与 Review 双重评审机制,能在隔离沙箱中自动发现、分类、复现并验证软件漏洞补丁,有效将 AI 扫描代码时的误报率控制在极低水平。
- 适用人群:[DevSecOps 工程师 / 安全研究员 / 基础架构运维]
- 体验通道:Google Cloud 官方博客
电商智能体架构指南与开源套件 — Anthropic
- 更新内容:Anthropic 发布针对零售与电商场景的最佳实践指南,推荐采用单一主力 Claude 配合特定技能与工具的标准 Agent 架构,并开源了包含购物与商家管理智能体的参考实现代码库
anthropics/commerce-agents。 - 适用人群:[电商架构师 / AI 智能体应用开发者 / 零售科技从业者]
- 体验通道:Anthropic 官方博客
行业动态
传 NVIDIA 正就 129 亿美元收购 Hugging Face 进行深入谈判 — 彭博社 / 行业动态
- 事件概述:据彭博社报道,NVIDIA 正接近以约 129 亿美元(最高或达 140 亿美元)收购开源 AI 社区龙头 Hugging Face,交易预计还将包括约 10 亿美元的员工留任激励方案。
- 影响分析:若收购达成,NVIDIA 将直接把全球最大的开源 AI 社区与模型枢纽收入麾下,进一步夯实从底层算力芯片到上层模型生态的绝对统治地位。
- 新闻链接:
Bloomberg: Nvidia is nearing a $12.9B Hugging Face acquisition.
— Rohan Paul (@rohanpaul_ai) September 2, 2026
At this price, its about 2.9x Hugging Face's $4.5B valuation from its 2023 funding round.
Nvidia also talking to add a $1B employee retention package to the deal. https://t.co/Y0SbXRVO5t pic.twitter.com/cOKNx9SbkK
美国司法部发声支持 AI 训练版权“合理使用” — 行业动态
- 事件概述:美国司法部在《纽约时报》起诉 OpenAI 的版权案件中提交建议陈述,明确主张使用公开版权文本训练大语言模型通常应被认定为具有“高度转换性”的合理使用(Fair Use),并警告全面许可要求会削弱美国 AI 开发者竞争力。
- 影响分析:该陈述为全美大模型预训练的数据合规注入了强心针,有望为未来一系列生成式 AI 数据版权判决树立重要的司法风向标。
- 新闻链接:
The Trump administration has now formally put the U.S. government behind OpenAI’s core fair-use argument in its copyright fight with The New York Times.
— Rohan Paul (@rohanpaul_ai) September 2, 2026
some of the most conclusive statements they said in their filed document.
- “the ‘training of AI models on copyrighted… https://t.co/7MTZirugdz pic.twitter.com/Ht9fWI6DU2
Palo Alto Networks 斥资 5 亿美元收购 AI IT 创企 Console — TechCrunch
- 事件概述:网络安全巨头 Palo Alto Networks 宣布以 5 亿美元现金加股票收购成立两年的 AI IT 服务台初创公司 Console,将其智能体能力全面融入 Cortex 安全运营平台。
- 影响分析:这是 Palo Alto Networks 今年的第七起 AI 收购,凸显了安全运维与企业 IT 支持场景全面走向“自主智能体化”的产业整合趋势。
- 新闻链接:TechCrunch 报道
论文研究
HarnessDev: 面向自进化智能体 Harness 的系统构建与评测 — 字节跳动 Seed 团队
- 研究动机:现有的自进化智能体研究大多关注单次任务完成度,缺乏对智能体自主构建与迭代“执行 Harness(脚手架)”能力的系统评估。
- 核心创新:提出 HarnessDev 机制,让模型从极简种子出发,自主设计并完善包含编排、状态管理与反馈机制的完整 Harness,并以任务成功率与 Token 消耗效率联合评分。
- 研究成果:在 4 大领域、2,207 个测试集上的实验表明,虽然在代码与搜索领域与成熟的人工 Harness 仍有差距,但在写作与机器学习实验领域已能够比肩甚至超越人工设计的 Harness。
- 论文地址:
Banger paper from ByteDance Seed.
— elvis (@omarsar0) September 2, 2026
If you are curious about self-evolving agent harnesses, this one is worth your time.
(bookmark it)
The proposes method, HarnessDev, stops scoring a model on the tasks it completes and scores it on the harness it builds.
The agent starts from… pic.twitter.com/2djSfAGiVp
HarnessEvolve: 基于参考轨迹的可靠智能体自我进化框架 — DAIR.AI / arXiv
- 研究动机:自进化智能体在缺乏明确中间反馈时容易产生错误归因,且无约束的更新往往会导致已掌握能力的“灾难性遗忘”。
- 核心创新:引入基于黄金参考轨迹的对齐机制与防护栏,使智能体能够在微调自身行为策略的同时,严格保留既往基础通用能力。
- 研究成果:有效消除了自进化过程中的错误归因现象,显著提升了智能体在长周期任务探索中的收敛稳定性与泛化能力。
- 论文地址:arXiv 论文页面
FM-Bench: 评估大模型二十年长程决策能力的足球经理基准 — arXiv
- 研究动机:现有基准测试大多局限于单步或短程任务,缺乏对大模型在复杂、多变量且跨越数十年长周期动态环境中决策能力的严苛检验。
- 核心创新:构建了包含 20 个模拟赛季、数百个决策节点的足球俱乐部管理仿真环境 FM-Bench,全方位考察转会、合同、财务及投资决策。
- 研究成果:对 15 款主流前沿模型的评测揭示了当前模型在跨周期资本管理与延时回报权衡上的显著短板,为长程决策优化提供了全新评估手段。
- 论文地址:
Current agent benchmarks may be ending before the real failures start.
— Rohan Paul (@rohanpaul_ai) September 2, 2026
FM-Bench shows that a model can look strong after 5 years and still finish far behind after 20, so long-running agents need long-running evaluations.
FM-Bench has 15 frontier models manage a football club… pic.twitter.com/WKb8CcltOi
其他分享
zg (zvec-grep): 统一 ripgrep、BM25 与向量搜索的本地优先搜索工具 — Qwen 开发者组织
- 内容简介:Qwen 开发者团队开源了基于 Node.js/Rust 的本地命令行工具
zg(zvec-grep)。它将传统的正则代码搜索(ripgrep)、词法搜索(BM25)与语义向量搜索统一到单个本地优先接口,默认模型无需 GPU 即可在个人电脑上实现毫秒级混合代码库检索。 - 传送门:MarkTechPost 报道
fable51-worlds: Fable 5.1 智能体集群端到端程序化构建 3D 街区 — PhiloLabs
- 内容简介:PhiloLabs 开源了 fable51-worlds 项目。该项目展示了完全由 Claude Fable 5.1 智能体集群自主完成研究、建模、纹理生成与质检的真实街区三维重建,最终交付为轻量级纯 Three.js Web 应用,无需任何外部 3D 引擎或专有格式。
- 传送门:GitHub 仓库
GitHub 降本实战:如何在不牺牲质量的前提下降低 AI 推理成本 — GitHub 官方博客
- 内容简介:GitHub 工程师 Erik Kristensen 撰文分享了 Copilot 团队在工程落地上的一系列降本实践:包括选择性压缩工具输出上下文、精简 Task-Tool 提示词(每轮节省约 1,300 Token)、去除无意义行号前缀等,在保障任务准确率的前提下有效削减了推理开销。
- 传送门:GitHub 官方博客



