AI日报|Cursor 推出 Origin 代码托管;OpenAI 发布安全防御路线图;Anthropic 年化收入达 650 亿美元
模型发布/更新
EVIE-Preview-4.5B — 腾讯 (Tencent)
- 一言以蔽之:腾讯开源基于 Qwen3.5-4B 构建的多语言视觉文档检索(VDR)模型 EVIE-Preview-4.5B,向量存储与索引成本降低 8 至 32 倍。
- 核心亮点:
- 采用 Late Interaction 架构,生成原生 128 维超紧凑多向量表示,在 ViDoRe V3 榜单中击败多个 8B 规模模型。
- 结合 GatedDeltaNet 线性注意力与全注意力混合建模,在保持极低检索延迟的同时实现了高精度的跨语言文档匹配。
- 技术规格:4.54B 参数 / 开源 (Hugging Face) / 128D 向量表示 / BF16 精度
- 传送门:Hugging Face 模型主页
Ling 3.0 (Tiny & Flash) — 蚂蚁集团 / Inclusion AI
- 一言以蔽之:蚂蚁集团开源的推理大模型 Ling 3.0 系列获得 llama.cpp 官方合并支持,成为低配置设备的推理首选。
- 核心亮点:
- Ling 3.0 Tiny(8B 总参数 / 1.3B 激活参数)在本地低显存设备上可达 36 token/s 的推理速度,表现媲美 Qwen 3.5 9B。
- 包含 Tiny 与 Flash(124B / 5B 激活)两个版本,均采用 MoE 结合推理强化架构,全面适配轻量化与边缘部署。
- 技术规格:开源 (GitHub / Hugging Face) / MoE 架构 / GGUF & llama.cpp 原生支持
- 传送门:llama.cpp Pull Request #26608
产品发布/更新
Cursor Origin 代码托管服务 — Cursor / Anysphere
- 更新内容:Cursor 针对付费用户推出自有代码托管平台 Origin 早期测试版,试图构建彻底脱离 GitHub 传统模式的新一代 AI 协同仓库。Origin 深度集成 Cursor,支持仓库、拉取请求(PR)、双向 GitHub 同步,并已打通 Vercel、Buildkite 与 Depot 的自动化部署。
- 适用人群:[全栈工程师 / 独立开发者 / AI 原生软件团队]
- 体验通道:Cursor 更新日志
Claude Code 新增 /design 命令 — Anthropic
- 更新内容:Anthropic 为 Claude Code 终端引入
/design技能研究预览版。该功能将 Claude Design 的画板(Canvas)工作流直接融入 CLI 与桌面端,用户生成 UI 后可在可编辑画板中实时预览并直接命令 Claude 完成前端代码交互实现。 - 适用人群:[前端开发者 / UI/UX 设计师 / 产品经理]
- 体验通道:
Claude Code can design now. The new /design skill (research preview) brings Claude Design's artboard workflow into the CLI and Desktop, built on artifacts.
— ClaudeDevs (@ClaudeDevs) August 17, 2026
Run /design to get editable artboards for your UI — pick one, tweak it, then have Claude implement it. pic.twitter.com/uttl4F1G0e
Agent Development Kit (ADK) 零信任架构 — Google
- 更新内容:Google 开源基于 ADK 和 Gemini 构建的零信任 AI 智能体应用架构。该架构明确强调提示词(Prompt)仅为软约束,并提供“加密签名不可抵赖写入”、“gVisor 沙箱代码隔离”与“确定性语义网关”三层硬性安全屏障,有效抵御提示注入与越权攻击。
- 适用人群:[AI 安全工程师 / 企业系统架构师 / 智能体开发者]
- 体验通道:Google 开发者博客
ElevenLabs MCP 集成 Claude — ElevenLabs & Anthropic
- 更新内容:ElevenLabs 发布官方 MCP(Model Context Protocol)服务器,允许用户与团队直接在 Claude 会话中管理语音和对话智能体。支持查看运行性能、创建与调整配置,甚至在部署生效前预估 LLM 运行成本,无需配置自建服务器。
- 适用人群:[语音应用开发者 / 智能客服构建者 / 内容创作者]
- 体验通道:
Introducing the ElevenLabs MCP, now available in Claude.
— ElevenLabs (@ElevenLabs) August 17, 2026
Your team can manage your voice and chat agents where you already work - review recent performance, create new agents, update configurations, and even estimate LLM costs before changes go live. pic.twitter.com/RkGqlr3I0h
Replit 黑盒渗透测试与自动修复 — Replit
- 更新内容:Replit 为平台应用引入自动黑盒渗透测试功能,模拟外部攻击者的路径对代码库进行安全扫描。扫描发现的安全漏洞可由 Replit Agent 一键生成修复补丁,大幅降低应用安全运维门槛。
- 适用人群:[Web 开发者 / 初创公司创始人 / 自动化运维人员]
- 体验通道:
You can now run black-box pen tests for your Replit apps.
— Replit ⠕ (@Replit) August 17, 2026
Security scans that test your Replit apps the way external attackers do.
Replit Agent can fix what it finds in a single click. pic.twitter.com/AyPkiBffFa
行业动态
OpenAI 发布《The Defender’s Window》:全面转向自动化安全防御
- 事件概述:OpenAI 发布安全技术白皮书《The Defender’s Window》,强调未来数月将训练模型编写“超人类安全代码”。面对 AI 攻击威胁,OpenAI 倡导通过 Codex 自动化漏洞验证、智能体分流告警以及持续枚举攻击路径来加固防御体系,并演示了 ChatGPT Work 在 15 分钟内发现并在一小时内修复 13 个安全漏洞。
- 影响分析:随着前沿大模型攻击能力的提升,传统手动安全审计已难以为继,利用大模型构建自动化防御壁垒将成为企业级基础设施的标准配置。
- 新闻链接:OpenAI 官方博客
英伟达联合 SB Energy 为 OpenAI 锁定 4.25 吉瓦算力园区
- 事件概述:英伟达(NVIDIA)宣布与 SB Energy 达成合作,锁定俄亥俄州 PORTS-Pike 科技园区的独家电力容量(LPS),用以构建 AI 工厂,OpenAI 将作为首批租户入驻。初始部署预计提供 4.25 吉瓦容量,对应每代系统约 150 万块英伟达 GPU,OpenAI 承诺在 2030 年前在该项目中部署高达 12 至 16 吉瓦的算力规模。
- 影响分析:大型 AI 实验室正从“购买芯片”演变为“直接包揽吉瓦级电力基础设施”,英伟达通过绑定能源与金融担保,进一步加深了对超大规模算力市场的统治力。
- 新闻链接:NVIDIA 官方博客
Anthropic 年化收入(ARR)达 650 亿美元,筹备 2 万亿美元估值 IPO
- 事件概述:据彭博社报道,Anthropic 私下向投资者透露,其 2026 年 7 月的年化收入运行率(ARR)已跃升至 650 亿美元,远高于 5 月的 470 亿美元,且实现调整后营业利润转正。投资者预期 Anthropic 在接下来的 IPO 中估值可能达到 2 万亿美元或更高。
- 影响分析:企业级 API 与 Claude 订阅需求的爆发式增长证明了闭源前沿模型的强大商业化能力,也直接提升了整个 AI 板块在资本市场的估值天花板。
- 新闻链接:
Anthropic’s annualized revenue reportedly hit $65 billion by the end of July, more than 7x its run rate at the end of 2025.
— Chubby♨️ (@kimmonismus) August 17, 2026
Bloomberg says the company generated over $11.5 billion in its latest completed quarter, up from $787 million in the same period last year, while posting… https://t.co/9azFFJ4G9a pic.twitter.com/oDFIcg5U6q
独家调查:AirTag 追踪证实亚马逊拆毁珍本图书用于训练 AI
- 事件概述:科技媒体 404 Media 通过在批量出售的珍本图书中植入 Apple AirTag 追踪器,证实亚马逊在拉斯维加斯的算力设施(VGT3)中将大批通过商业渠道收购的珍本图书进行拆页扫描,以获取高质量语料训练前沿模型,扫描完成后图书被直接销毁。
- 影响分析:该调查证实了出版界长期以来的怀疑——前沿 AI 巨头正通过无差别买断纸质藏书以规避互联网版权纠纷,也再次引发了关于 AI 训练数据集来源道德性与破坏传统物理文献的深刻讨论。
- 新闻链接:404 Media 深度报道
算力芯片初创公司 Groq 完成 3.5 亿美元 A 轮融资
- 事件概述:LPU 芯片研发商 Groq 宣布完成 3.5 亿美元 A 轮融资,由 Disruptive Tech 领投,英伟达参投,公司估值达到 35 亿美元。Groq 计划在明年将其基础设施规模从 54 兆瓦扩展至 200 兆瓦以上。
- 影响分析:低延迟推理(Inference)正逐渐成为 AI 基础设施的关键战场,Groq 与英伟达的资金结合表明极速推理算力将在未来智能体大规模落地中占据举足轻重的地位。
- 新闻链接:
Today we announced a $350M Series A led by @disruptivetech, with planned participation from @nvidia, valuing Groq at $3.5B and bringing our total to $1B raised in two months.
— Groq Inc (@GroqInc) August 17, 2026
Inference is becoming the largest and most critical layer of AI infrastructure and it's what we do…
论文研究
Harness-IF:编码智能体对抗性指令遵循评估基准 — 字节跳动 (ByteDance)
- 研究动机:评估当前编码智能体(Coding Agent)在系统提示词、工具描述与实际指令发生冲突或与其默认行为偏好相反时的真实遵循表现。
- 核心创新:构建 Harness-IF 评估框架,将对抗性约束分散包含在系统提示、技能描述与项目代码文件中,全面考察模型的可控性。
- 研究成果:测试 12 个主流前沿模型后发现,所有模型在对抗性环境中的遵循得分均显著下降,表明目前社区对于智能体行为的可控程度存在过度乐观的误判。
- 论文地址:
New ByteDance paper asks a much better question about AI agents: did the instruction actually change anything?
— Rohan Paul (@rohanpaul_ai) August 17, 2026
We might be overestimating how controllable AI agents are because our tests often agree with their defaults.
Want to know whether your agent actually follows… pic.twitter.com/UblOpujrXo
长上下文智能体会话压缩后的规则遗忘机制 — 宾夕法尼亚大学 (UPenn)
- 研究动机:分析自主智能体(Agent)在进行长会话上下文压缩(Compaction)后,为何频频出现遗忘用户系统规则或安全边界的问题。
- 核心创新:揭示了现有上下文压缩算法倾向于保留主线任务而丢弃“隐形约束”的缺陷,并提出使用独立的 9B 参数轻量提取器在压缩后自动重构规则列表。
- 研究成果:实验显示原生压缩器平均仅保留 17% 的会话约束规则,而引入重构提取器后规则保留率大幅提升至 90% 以上。
- 论文地址:
A scary finding from new Pennsylvania Uni paper.
— Rohan Paul (@rohanpaul_ai) August 17, 2026
AI agents can go off-script in a simple way: they can forget your rules while still remembering the job.
If a rule must survive the whole session, normal chat history may be the wrong place to store it.
Say you tell an agent,… pic.twitter.com/lmyo0Fv3vL
其他分享
GitSkills:380 万智能体技能开源数据集
- 内容简介:社区开发者整理并发布了包含 GitHub 上 282,200 个公共仓库中约 380 万份
SKILL.md文件的全新数据集 GitSkills。整个数据集经过归并去重整理为 187 万条不同技能规则,以单个 SQLite 文件形式开放下载,为研究智能体设计模式与自动生成技能库提供了极具价值的数据资产。 - 传送门:
Recommended resource. Largest dataset of agent skills I’ve come across. Great for mining cool ideas and patterns for your agents. https://t.co/z00rGoYPaT
— elvis (@omarsar0) August 17, 2026



