AI日报|Cognition 发布 SWE-2 编码模型;Microsoft Copilot 全面引入 Grok 模型;萨提亚·纳德拉谈 AI 护城河
模型发布/更新
SWE-2 — Cognition
- 一言以蔽之:Cognition 正式发布全新编程大模型 SWE-2,由 2.8T 参数的 Kimi K3 经强化学习后训练打造,在性能上比肩 Fable 5.1 且成本大幅降低。
- 核心亮点:
- 媲美顶尖前沿的表现:在 FrontierCode 1.1 Main 基准测试中斩获 50.0% 的高分,与当前顶尖的 Fable 5.1 仅相差不到 1 分。
- 极致的性价比优势:在实现同级高强度代码生成与修复能力的同时,将推理与调用成本直接削减了 64%。
- 技术规格:Kimi K3 后训练 / 强化学习优化 / 编程专项大模型
- 传送门:MarkTechPost 深度报道
Grok 系列模型接入 Microsoft Copilot — xAI / 微软 (Microsoft)
- 一言以蔽之:微软宣布将 xAI 旗下的 Grok 模型正式引入 Microsoft Copilot 办公生态,率先在 Word、Excel 和 PowerPoint 中落地。
- 核心亮点:
- 办公套件的多模型融合:微软 Copilot 进一步拓展模型矩阵,引入 Grok 强大的逻辑与实时处理能力,为文档起草、表格分析和演示文稿生成带来全新体验。
- 面向企业与前沿客户的定向释放:该功能目前正率先面向微软 Frontier 计划的客户群体推送,后续将逐步扩大覆盖范围。
- 技术规格:多模型集成 / Office 365 深度嵌入 / 微软 Frontier 计划专属
- 传送门:
More model choice coming to Copilot. Welcome Grok! https://t.co/7Rzg8zUrjb
— Satya Nadella (@satyanadella) September 12, 2026
产品发布/更新
HumanLayer 多人实时提示词协作 — HumanLayer
- One-sentence summary:HumanLayer 推出多人实时提示词协作功能,支持开发团队在无需依赖云端集中智能体的前提下,共同编写与调度本地/边缘端运行的编码智能体。
- 更新内容:打破了单人单会话的传统限制,支持团队成员对同一条提示词进行实时协同编辑;底层基于 durable streams 与 Rivet actors on ECS 构建,可无缝对接笔记本、Mac mini 以及 GitHub Actions 等各种一次性算力环境中的智能体会话。
- 适用人群:[全栈开发团队 / 智能体架构师 / 协作办公用户]
- 体验通道:
coming soon to a humanlayer new you:
— dex (@dexhorthy) September 12, 2026
live multiplayer prompting - co-author a single prompt with your team.
A few weeks ago we shipped "send a prompt to your colleague's session" - now we made each individual prompt collaborative.
No cloud agents required, works wherever you… pic.twitter.com/6sMMm8fVP0
行业动态
萨提亚·纳德拉谈 AI 护城河:真正的优势不在基础模型,而在企业独占的“学习循环”
- 事件概述:微软 CEO 萨提亚·纳德拉(Satya Nadella)在斯坦福在线访谈中明确指出,随着基础模型日渐成为普惠工具,企业的核心竞争力已不再取决于选用哪家大模型,而在于能否构建出专属的学习循环(Learning Loops)。
- 影响分析:纳德拉强调,企业必须将日常运营转化为可积累的数字资产。通过建立私有评测体系、沉淀工作流轨迹并结合人工判断,企业能够打造出可持续进化的“爬坡机器”,将业务知识内化为长效 IP,而非仅仅沦为基础模型的浅层消费者。
- 新闻链接:
"loop" is all you need. 🙂 https://t.co/outZXizlFy pic.twitter.com/sho5JvVaki
— Rohan Paul (@rohanpaul_ai) September 12, 2026
Perplexity CEO Aravind Srinivas 驳斥传统经济学理论:GDP 无法衡量 AI 带来的巨大隐性财富
- 事件概述:Perplexity CEO Aravind Srinivas 发文指出,现行的经济学理论与统计指标(如 GDP)已经严重过时,根本无法正确评估 AI 技术为社会创造的真实财富。
- 影响分析:他以“用 ChatGPT 指导修复家电从而省下购买新机的开销”为例,指出这类节省时间和金钱的“无形增值”实际上增加了实际财富,但由于没有产生新的货币交易,反而不会被 GDP 记录。这解释了为什么宏观指标常与微观用户的强烈获得感产生错位。
- 新闻链接:
Quite an important take. Economists and their theories are outdated to measure the benefits of AI. AI is already saving people a lot of time and money that doesn’t get measured. https://t.co/JKqzmg8MxP
— Aravind Srinivas (@AravSrinivas) September 12, 2026
François Chollet 详解 ARC 4 与 ARC 5 规划:聚焦开放式发明基准并向行业发出监管警示
- 事件概述:Keras 作者、AI 科学家 François Chollet 透露,团队自一年前便开始构建“开放式发明基准”,相关成果将作为即将到来的 ARC 4(计划于明年第一季度发布)和 ARC 5 的核心技术底层。
- 影响分析:Chollet 同时警告称,应对 AI 前沿风险时必须警惕“监管俘获”的隐患,真正的监督需要具备类似于核监管委员会的民主问责形式,且不应以安全为借口盲目封杀开源 AI 或阻碍安全可靠的非前沿研究。
- 新闻链接:|
About a year ago, before it was on anyone's radar, we began exploring the idea of a benchmark for open-ended invention. Since then, we've developed several promising directions that will serve as the foundation for ARC 4 and ARC 5.
— François Chollet (@fchollet) September 12, 2026
We're incredibly excited to share what we've… https://t.co/eVa47q7X8cI hope the proposals by frontier labs to pace AI research stem from a genuine concern for safety and a recognition of the potential risks posed by future models, rather than a strategic effort to consolidate power and permanently solidify the market dominance of a few top…
— François Chollet (@fchollet) September 12, 2026
论文研究
Fly Language Model (FLM): Wiring the Full Fruit Fly Connectome into a Frozen LLM — 独立前沿研究团队
- 研究动机:探索将复杂的生物神经网络全景(如昆虫连接组)直接硬编码到大语言模型架构中,是否能为人工神经网络带来类似生物演化的感知或推理增益。
- 核心创新:研究团队将完整的 MaleCNS v1.0 果蝇连接组直接接入一个冻结的 1.2B 基础大模型中,整个训练过程仅微调了 27.8 万个参数(占主干参数的 0.0238%)。
- 研究成果:通过严格的自身对照实验发现,接入具体的生物连接结构并未在基准测试中带来显著的性能增益,为“生物硬编码结构是否直接适用于大模型”提供了重要的反面实证数据。
- 论文地址:MarkTechPost 论文解析
其他分享
Hugging Face Training Agents 全套实公开与代码开源
- 内容简介:由 Hugging Face 团队发起并主导的
Training Agents6 个月系列直播与工坊代码正式全部开源。项目完整串联了从智能体评估、强化学习(RL)理论、基于 Agent Trace 的 SFT 微调、模型蒸馏、GRPO 强化学习到真实环境 RL 的全链路实战。 - 传送门:GitHub 仓库
Ambient CSS:为前端组件注入物理光照模型的全新开源库
- 内容简介:一款令人惊艳的实验性开源 CSS 样式与组件库。它引入了物理光照模型,可直接为 React 组件和普通 DOM 元素渲染出逼真的高光、阴影与表面材质(如按钮、旋钮、滑条等),让网页拥有媲美专业三维渲染的质感。
- 传送门:
https://t.co/PNLB6szx9H
— Viking (@vikingmute) September 12, 2026
Ambient CSS 非常漂亮,也没有见过类似的库,用物理光照模型给 CSS React 组件做高光、阴影和表面材质 作者把同一套几何和灯光同时在 Blender里渲染 在浏览器里用 box-shadow 和 CSS 变量复现
有不同光源 材质的效果 还有组件:按钮 旋钮 滑条 推子 开关等… pic.twitter.com/QGkgYYaOHI
Guillermo Rauch:当 Agent 成为新型编译器
- 内容简介:Vercel CEO Guillermo Rauch 分享了团队在工程实践中的深刻观察:随着智能体能力的跃升,团队使用 Zig、Go、Rust 等底层语言项目的迭代速度已经彻底追平 TypeScript 与 Python。语言和运行时的选择不再受限于人类的编写便利度,因为“Agent 正在成为新型编译器,将人类意图直接编译为高性能软件”。
- 传送门:
I’m seeing teams at Vercel iterate just as fast on Zig, Go, Rust projects as TypeScript & Python ones.
— Guillermo Rauch (@rauchg) September 12, 2026
The days of language or runtime choice based on human convenience are over. Agents are the new compilers.
They compile intent into fast software.

