AI 日報|OpenAI 達成自動化研究實習生里程碑與對齊示警、黃仁勳宣佈 AGI 到來、Viggle-Animate 開源
模型發布/更新
Viggle-Animate — Viggle
- 一言以蔽之:Viggle 正式開源影片角色替換工具 Viggle-Animate,支援使用者在本地 PC 僅需單張圖片與 3 步操作即可完成流暢的角色動態替換。
- 核心亮點:
- 極簡工作流:無需傳統複雜的 Pose、Mask、Face 或 Depth 控制管線,僅需單幀圖片輸入即可生成高一致性的人物動態影片。
- 本地硬體友善:大幅最佳化推論效率,開放開源權重與 Hugging Face 線上體驗入口,讓創作者能在消費級顯示卡上輕鬆執行。
- 技術規格:開源視覺角色動畫模型 / 支援本地 PC 部署與 Hugging Face 整合
- 傳送門:Viggle-Animate Hugging Face 專案頁
NeoMME (260M / 800M) — H Company
- 一言以蔽之:H Company 推出 NeoMME 輕量級單塔多模態編碼器系列,全面捨棄獨立視覺塔與因果解碼器設計。
- 核心亮點:
- 統一單塔架構:採用單一雙向 Transformer 架構同時處理多語言文字與 32×32 影像塊,實現真正的跨模態統一表示。
- 離散遮蔽擴散預訓練:透過離散遮蔽擴散(Discrete Masked Diffusion)演演演算法進行訓練,在極小引數量下大幅降低多模態特徵對齊的計算冗餘。
- 技術規格:260M 與 800M 引數雙向 Transformer / 遮蔽擴散多模態編碼器
- 傳送門:MarkTechPost 技術報導
產品發布/更新
Copilot Canvases 視覺化工作流協作介面 — GitHub
- 更新內容:GitHub 為 Copilot 推出全新「Canvases」介面,為多 AI Agent 的程式設計與審查提供持久、可共享的視覺化畫布。開發者不再需要於繁雜的對話紀錄中往返捲動,可直觀追蹤各 Agent 的執行進度、程式碼 Diff 變更以及待審查節點。
- 適用人群:[軟體工程師 / 技術主管 / 開源專案維護者]
- 體驗通道:
Stop scrolling...
— GitHub (@github) September 6, 2026
...through those agent chats.
Canvases give your workflow a durable, shared surface to track what ran, changed, and needs review.
How it works 👇https://t.co/pMwe9YhsuS
YoLive 萬人群體即時共創生成式直播 — Yoroll / MiniMax
- 更新內容:基於 MiniMax H3 開源生態與 Yoroll H3 Superfast 極速生成引擎(4 秒生成 10 秒影片),Yoroll 上線互動平臺 YoLive。所有觀眾皆可在直播間即時提交劇情提示詞並投票,系統會自動選取最高票提示詞並即時生成下一段連續劇情,打造永不停歇的群體共創電影。
- 適用人群:[數位內容創作者 / 互動敘事開發者 / 遊戲玩家]
- 體驗通道:
当AI视频生成速度超过Prompt输入速度,永不停息的AI直播诞生了。
— 向阳乔木 (@vista8) September 6, 2026
MiniMax H3开源后,涌现出一批高速视频生成模型。Yoroll自己也发了一个H3 Superfast模型,4s耗时可以生成10s视频。
还上线了一个新产品——YoLive,支持每个人都能输入提示词,但用得票最多的提示词生成故事走向。… https://t.co/tt04UrmOe1
Atlas 空間多模態 3D 重建與生成模型 — World Labs
- 更新內容:由李飛飛博士與 Justin Johnson 共同創立的 World Labs 揭曉其核心模型 Atlas 的架構理念。Atlas 將過往電腦視覺中割裂的「3D 幾何重建」與「生成式視覺創作」合而為一,原生支援文字、影象、影片與相機軌跡姿態輸入,並將 3D 空間作為原生 Token 進行運算。
- 適用人群:[3D 動畫師 / 遊戲開發者 / 機器人感知工程師 / 空間運算開發者]
- 體驗通道:
World Labs co-founders Justin Johnson and Dr. Fei-Fei Li say Atlas unifies the two things computer vision has always kept apart:
— a16z (@a16z) September 6, 2026
Justin: "Historically, reconstruction has been its own subfield in computer vision with its own specialized tasks and models. Generation is what all… https://t.co/PPwWYqV088 pic.twitter.com/XGZg0SB9xS
產業動態
OpenAI 披露內部研發加速資料與《An Alien Mind》安全警示
- 事件概述:OpenAI 正式發布內部研發加速報告,宣佈已達成「自動化研究實習生」里程碑(可在人類監督下自主完成需耗時數天的研究任務),內部 Agent 工作時長已達人類的 3.1 倍,研究者實驗迭代速度提升至 2025 年基線的 1.6 倍,並計畫於 2028 年 3 月推出完全自主的 AI 研究員。同日,OpenAI 首席科學家 Jakub Pachocki 發表長文《An Alien Mind》,指出隨著模型推論能力暴增,思考鏈(CoT)監控的效果正逐步衰退,目前尚無任何實驗室能保證全速擴充套件下的完全對齊,呼籲業界自願放緩擴充套件並建立跨國安全協調標準。
- 影響分析:遞迴自我改進(RSI)已在前沿實驗室內部實質運作,大幅拉開內部研發與外界常態研發的生產力差距;然而核心高層公開呼籲安全減速,顯示超人類系統的安全與控制已成為頂級實驗室迫在眉睫的巨大挑戰。
- 新聞連結:OpenAI 內部研發加速報告 與 Jakub Pachocki 長文:An Alien Mind
黃仁勳稱 GPT-6 Astra 標誌 AGI 到來,下一波 40 萬 GPU 算力將上線
- 事件概述:NVIDIA 執行長黃仁勳公開表示,GPT-6 Astra 仰賴約 10 萬餘顆 NVIDIA Grace Blackwell NVLink72 叢集訓練完成,從 ChatGPT、o1 到 Astra 歷時 4 年,標誌著通用人工智慧(AGI)時代正式到來,並透露接下來將有 40 萬顆新一代 GPU 上線支援後續訓練。OpenAI 共同創辦人 Greg Brockman 隨後轉發認同。
- 影響分析:引發了產業界與學界(如 Gary Marcus、François Chollet 等)關於「AGI 定義與評測基準」的激烈辯論;同時也預告超大規模運算叢集將持續推升下一階段人工超智慧(ASI)的硬體門檻。
- 新聞連結:
we're now moving into the AGI era (whether you view it as this model, the last one, or the next one), and could not do it without close partners https://t.co/DBPF7QRqyJ
— Greg Brockman (@gdb) September 6, 2026
NVIDIA 傳洽談向 Mira Murati 新創 Thinking Machines Lab 投資 25 億美元
- 事件概述:據 The Information 報導,由前 OpenAI 技術長 Mira Murati 創立的 Thinking Machines Lab 正以逾 400 億美元的投前估值尋求 50 億至 60 億美元融資。其中 NVIDIA 正洽談出資約 25 億美元,創投機構 Accel 擬領投。該公司年化營收已達數億美元,主打企業專屬資料客製化與開源權重模型。
- 影響分析:凸顯出頂級前沿模型人才創立的新創公司依然吸金能力驚人,晶片巨頭 NVIDIA 透過深度注資頂級模型團隊,進一步鎖定未來的算力採購份額。
- 新聞連結:
Crazy Nvidia is reportedly discussing a $2.5 billion investment in Mira Murati’s Thinking Machines Lab as it backs open-weight alternatives to OpenAI and Anthropic at an at least $40 billion valuation.
— Chubby♨️ (@kimmonismus) September 6, 2026
TML is seeking $5 billion to $6 billion at a pre-money valuation of at least… https://t.co/KnSz1GFF55 pic.twitter.com/4K1znVKeS7
Anthropic 承諾 5,170 億美元算力協議引發盈利爭議
- 事件概述:媒體披露 Anthropic 已簽署高達 5,170 億美元的長期算力採購承諾,約為其先前向投資人透露規模的 3 倍。
- 影響分析:前沿模型實驗室的算力軍備競賽已進入天文數字規模,在模型推理價格持續因開源與蒸餾技術大幅走低(如 18 個月內單位 Token 價格降幅達千倍)的背景下,基礎模型供應商如何建立長期可持續的獲利商業模式成為市場焦點。
- 新聞連結:
🚨scoop from @theinformation:
— Gary Marcus (@GaryMarcus) September 6, 2026
Anthropic (which has yet to established stable profitability) has committed to $517 billion in compute deals - almost 3x what they had previously told investors.
by my estimate that’s about 1000x their most (only?) profitable* quarter thus far.… pic.twitter.com/BVEgvvk4bq
Seattle Times 與 Newsday 正式起訴 OpenAI 與微軟侵犯版權
- 事件概述:美國地方媒體巨頭 Seattle Times 與 Newsday 正式在聯邦法院起訴 OpenAI 與微軟,指控兩家公司未經授權使用其原創調查新聞訓練模型,並在 Copilot 與 ChatGPT 回答中實質重現報導段落。
- 影響分析:隨著版權訴訟從全國性大報(如紐約時報)蔓延至數百家地方新聞出版商,AI 資料授權協議與合理使用(Fair Use)的司法邊界正迎來更密集的判例檢驗。
- 新聞連結:The Verge 報導
Anthropic 15 億美元版權和解金引發出版社與作者份額分配爭議
- 事件概述:Anthropic 涉及近 50 萬部著作的 15 億美元集體版權和解案進入執行階段,但大批原作者反映出版商與文學經紀人正在未經授權的情況下超額認領屬於作者個人的賠償金(每部作品 3,000 美元),引發作家群體的集體抗議。
- 影響分析:反映出 AI 訓練資料版權侵權賠償在落地執行層面面臨權利歸屬界定不清的混亂局面,恐將促使未來的版權和解與授權合約更加細緻化。
- 新聞連結:TechCrunch 報導
論文研究
Meta FAIR 提出 AI Research Preference Models (RPMs) — Meta FAIR / 牛津大學 / UCL
- 研究動機:自主 AI 科學家在探索機器學習研究時會生成大量實驗想法,若盲目執行所有實驗將耗費難以承受的 GPU 運算時數。
- 核心創新:研究團隊提出「研究偏好模型(RPMs)」,將各實驗候選方案在未實際執行前進行成對比較與排序,僅排程算力執行評分最高的優勝實驗。
- 研究成果:RPMs 能精準過濾掉超過 70% 的低效益或無效實驗方案,在同等 GPU 預算下將有效研究產出提升逾 2.4 倍。
- 論文地址:MarkTechPost 論文解析專題
STAIR: 基於目錄結構定址的生成式檢索架構 — IBM Research
- 研究動機:傳統 RAG 檢索器多以固定長度切塊(Chunking),完全破壞了長文件原有的層級與全域上下文結構。
- 核心創新:STAIR 直接利用文件目錄(Table of Contents)作為生成式檢索器的定址編碼結構,將檢索空間錨定在真實的結構樹中。
- 研究成果:在 SearchTome 評測中達到 82.6% 的 Recall@1(大幅超越 BM25 的 59.5% 與 DPR 的 68.7%),並將生成式檢索常見的幻覺率壓低至 0.05% 以下。
- 論文地址:
Great RAG paper from IBM.
— elvis (@omarsar0) September 6, 2026
There are some really good ideas on how to solve common RAG issues.
It's well known that retrievers chunk long documents by length, which discards the hierarchy the document already has.
So they propose using a table of contents.
A table of contents… pic.twitter.com/AewQkTWEA6
Distilling Reasoning into Amortized Skills — 微軟研究院 / 康乃爾大學
- 研究動機:測試時推論運算(Test-Time Compute)雖然顯著提升了複雜任務的準確率,但每次推論呼叫成本極其昂貴且延遲高。
- 核心創新:收集推論模型在 35 至 50 條歷史執行軌跡中的失敗模式,由 Coding Agent 自動提煉出通用的修復規則並編譯成 Markdown 格式的「技能指令庫(Skills)」,直接注入一般非推論模型的系統提示詞中。
- 研究成果:使輕量模型 GPT-5.4-mini 在消耗極少 Token 的情況下,恢復了 55% 至 100%+ 原先僅高階推論模型才具備的任務成功率。
- 論文地址:
What if you could pay the reasoning cost once, then reuse what the model learned across future tasks?
— Rohan Paul (@rohanpaul_ai) September 6, 2026
New Microsoft paper finds that some expensive test-time reasoning can be replaced with a small set of rules learned from previous agent runs.
The paper tests a cheaper… pic.twitter.com/dMYAlCDPLs
其他分享
TinyCast:僅 5MB 記憶體佔用的極致輕量原生啟動器
- 內容簡介:針對許多使用者對桌面啟動器過度肥大化的痛點,開源專案 TinyCast 採用原生架構打造,磁碟空間僅佔 5MB、執行時記憶體消耗低於 100MB,且全面相容 Raycast Extensions 生態,成為高效率極簡開發者的全新熱門替代方案。
- 傳送門:TinyCast GitHub 倉庫
claude-transplant:跨帳號無縫轉移 Claude Code 歷史對話紀錄
- 內容簡介:針對擁有多個訂閱帳號的重度開發者在 Claude Desktop 切換帳號會遺失對話歷史的問題,開發者開源了 macOS 專用工具
claude-transplant。該工具可安全驗證並在不同 Organization 帳號間搬移 Session 紀錄,支援終端機與選單列一鍵操作。 - 傳送門:claude-transplant GitHub 倉庫
Blender MCP + GPT-6 Astra 掀起「文字直出 3D 遊戲關卡」熱潮
- 內容簡介:社群開發者廣泛驗證發現,結合具備 Computer Use 能力的 GPT-6 Astra 與 Blender MCP 伺服器,僅耗用極少額度即可在 Godot 引擎中一鍵生成具備晝夜光影、天氣系統、完整 3D 建模與行為邏輯的 Roguelike 遊戲關卡原型,展示出多模態 Agent 在 3D 資產與數位內容創作管線上的巨大破壞力。
- 傳送門:
GPT-6 Astra + Blender + Godot Engine
— 歸藏(guizang.ai) (@op7418) September 6, 2026
GPT-6 仅用 20X 3% 的额度,帮我做出了一个完整的 3D Roguelike 游戏关卡
昼夜循环、天气系统、3D 建模、贴图、武器切换、技能系统,以及近战和远程的小怪 pic.twitter.com/me2MyX4sRv



