AI日报|Gemini 3.8 Live 数字人登场;Perplexity 推出 Photon 高速检索架构;Google 计划将 TPU 送入太空
模型发布/更新
Gemini 3.8 Live with Live Avatar — Google DeepMind
- 一言以蔽之:Google 正式推出 Gemini 3.8 Live 及其配套的 Live Avatar 实时数字人功能,为对话式 AI 带来近乎实时的逼真视听交互。
- 核心亮点:
- 实时数字人驱动:支持高保真口型同步、丰富面部表情及 97 种语言无缝切换,且在说话时可动态调出屏幕辅助信息。
- 企业级安全保障:全面登陆 Gemini Enterprise,输出内容带有不可见的 SynthID 水印及严格的身份保护措施。
- 技术规格:云端 API / 支持多语言全双工语音与视觉同步 / 适用于网页与移动端
- 传送门:Google DeepMind 官方博客
Muse Realtime Avatar — Meta
- 一言以蔽之:Meta 在 Connect 大会上正式发布 Muse Realtime Avatar,将 Muse Realtime Voice 升级为具备高表现力的实时具身数字人。
- 核心亮点:
- 顶级表现力:在真人实测盲测中,Muse Realtime Avatar 在视觉质量、口型同步和行为一致性上均超越主流商业系统。
- 硬件生态联动:深度无缝对接 Meta 系列智能眼镜与终端设备,为全天候个人超级智能开辟全新视觉交互场景。
- 技术规格:云端与端侧融合 / 实时全双工流式交互
- 传送门:
产品发布/更新
Fast Search / Photon 架构 — Perplexity
- 更新内容:Perplexity 正式推出基于全新 Rust 编写的 Photon 检索和排序服务的 Fast Search API。相比传统架构,其 p99 响应时间大幅缩减至 65 ms 以下,同时节省了 20% 的服务器算力,单次搜索成本低至每千次 1 美元。
- 适用人群:[AI 开发者 / 搜索引擎构建者 / 高并发应用工程师]
- 体验通道:
Server Tools Marketplace — OpenRouter
- 更新内容:OpenRouter 推出一站式「服务器工具市场」,为大模型智能体原生提供网页搜索、Shell、工具搜索、图像生成和时间获取等后端服务。开发者可使用
defer_loading机制避免庞大工具库占用输入 Token,大幅提升智能体运行效率。 - 适用人群:[智能体架构师 / 全栈开发者]
- 体验通道:
LangSmith Engine v2 — LangChain
- 更新内容:LangChain 正式发布 LangSmith Engine v2,新增主动红蓝对抗(Red Teaming)机制和验证修复功能,能够在智能体问题暴露给用户之前自动识别、测试并修复其逻辑漏洞和性能衰退。
- 适用人群:[LLM 工程师 / AI 产品测试人员]
- 体验通道:
行业动态
Project Suncatcher: Google 计划将 TPU 送入太空测试
- 事件概述:Google 宣布启动 Project Suncatcher 项目,计划通过 SpaceX 的 Transporter-18 任务将 TPU 送入太空进行极限硬件生存测试,并与 Planet 合作在 2027 年发射原型卫星,利用激光链路协同处理太空中的 AI 计算负载。
- 影响分析:标志着超大规模算力基础设施正加速向太空拓展,为未来星际分布式 AI 计算奠定坚实的硬件基础。
- 新闻链接:
Anthropic 拟效仿 Palantir 架构授予 7 位创始人 50.1% 投票权
- 事件概述:据 The Information 报道,Anthropic 正在寻求股东批准一项新的治理结构,计划授予 CEO Dario Amodei 及其 6 位联合创始人合计 50.1% 的投票权,以确保核心团队在面对激进商业资本时的战略自主性。
- 影响分析:反映了顶尖 AI 实验室在商业化狂飙突进之际,创始人对技术路线长期愿景和安全防线的深度保护意图。
- 新闻链接:Rohan Paul 动态报道
GEO 污染漏洞曝光:374 家企业遭遇大模型虚假联系方式攻击
- 事件概述:安全研究者披露了一起针对 ChatGPT、Gemini 和 Google AI Overview 的生成引擎优化(GEO)恶意污染事件。黑客成功操纵大模型输出钓鱼电话和虚假客服链接,已导致 Delta、美航、美国银行等 374 家知名企业受影响。
- 影响分析:凸显了生成式 AI 时代检索增强生成(RAG)和搜索引擎优化(SEO/GEO)面临的严重安全隐患与信任危机。
- 新闻链接:Medium 深度安全报道
论文研究
Coherent Long-Form Video Generation with AI video co-director — Google Research
- 研究动机:长视频叙事在传统策略下缺乏全局优化和统一的创意配置,难以保证长流程叙事的连贯性。
- 核心创新:提出 AI video co-director 分层多智能体框架,用多臂老虎机(MAB)在创意策略、叙事模式和美学原型三个维度上自动搜索并配置全局最优方案。
- 研究成果:能够将复杂长剧叙事与视觉生成无缝衔接,大幅提升长视频的剧情连贯性与工业级可用性。
- 论文地址:Google Research 官方博客
无限参数 LLM 动态演化方案 — Boltzbit & 剑桥大学
- 研究动机:传统 LLM 在处理用户长文档和实时纠错时权重完全冻结,只能频繁塞进长 Prompt 导致显存飙升和注意力稀释。
- 核心创新:提出将实时交互数据通过轻量超网络(Hypernetwork)动态编译成低秩(LoRA)权重的动态演化机制,实现“把知识写进脑子而非 Prompt”。
- 研究成果:在长文本、多轮对话和复杂干扰任务中全面超越传统静态权重加 Context 方案,且显存开销与推理速度大幅优化。
- 论文地址:Hugging Face 论文动态
其他分享
Claude Opus 5.5 全自动生成 3D 游戏与手绘 MV
- 内容简介:社区涌现大量使用 Claude Opus 5.5 结合 Claude Code 完成的震撼创意案例。开发者仅通过几句提示词和参考图,便让模型在本地直接用纯代码(如 TypeScript / p5.js / Godot)全自动渲染并输出了 3D 棋类 Roguelite 游戏、精美手绘分镜 MV,甚至包含自研语音合成与音视频对齐,完全颠覆了传统数字内容的制作流程。
- 传送门:Reddit 社区详细讨论

