AI 日報|Qwen-Image-2.1 開源發布、Anthropic 建立實體濕實驗室進軍藥研、Step 5 Preview 旗艦模型登場
模型發布/更新
Qwen-Image-2.1 — Alibaba Qwen
- 一言以蔽之:阿里通義千問團隊正式開源 Qwen-Image-2.1,將文生圖與圖生圖編輯完美整合至輕量 7B 架構中,並原生支援透明影象處理。
- 核心亮點:
- 統一生成與編輯:單一 7B Checkpoint 同時支援高畫質影象生成與區域性修改,支援最多 10 張參考圖進行指令編輯,精確保留人像與產品特徵。
- 原生透明通道(RGBA):業界罕見地原生支援生成與編輯帶有 Alpha 通道的透明圖層,大幅提升前端排版與合成效率。
- 技術規格:7B 輕量化架構 / 開源模型(支援 ComfyUI 與 Hugging Face)
- 傳送門:Qwen 官方部落格
Step 5 Preview — 階躍星辰 (StepFun)
- 一言以蔽之:階躍星辰推出新一代旗艦基座模型 Step 5 Preview,在保持極高價效比的同時,展現出頂級的 Agentic 任務與金融專業表現。
- 核心亮點:
- 稀疏混合專家架構:總引數量達 600B、啟用引數僅 27B,原生支援 100 萬 Token 超長上下文與視覺多模態輸入。
- 強悍的價效比:在 Artificial Analysis Intelligence Index 中取得 44 分,位居全球開源模型前三;單任務成本僅為 Claude Opus 5 的 1 / 8。
- 技術規格:600B MoE(27B 啟動) / 1M 上下文 / 預計 10 月 15 日全面開源權重
- 傳送門:階躍星辰官方公告
Nano Banana 2.5 — Google DeepMind
- 一言以甄之:Google 預告即將推出代號
spicy-mayo的 Nano Banana 2.5 模型,主打強大的多尺寸與推理深度調節能力。 - 核心亮點:
- 動態思考等級:支援
minimal、medium、high三種思考強度切換。 - 靈活影象輸出:原生支援 512、1K、2K 及 4K 等多種影象尺寸生成。
- 動態思考等級:支援
- 技術規格:Google Vertex 平臺預先部署 / 即將全面發布
- 傳送門:
Nano Banana 2.5 is incoming soon from @GoogleDeepMind. 🔥
— Mark Kretschmann (@mark_k) September 20, 2026
This sample looks very promising: https://t.co/MrVNTpXyRa pic.twitter.com/CJHZhR60Nk
產品發布/更新
DocJev — LlamaIndex / Jerry Liu
- 一言以蔽之:LlamaIndex 共同創辦人 Jerry Liu 推出 DocJev,這是一套專為檔案分類與切片設計的超高速開源庫。
- 更新內容:結合 System 1 決策模型(Jev)與高效解析後端(如 liteparse 與 LlamaParse),能夠在保持同等準確率的同時,達到比 GPT-5.6 Luna 快 6 倍的處理速度,徹底解決大檔案處理的延遲痛點。
- 適用人群:[軟體工程師 / AI 應用開發者 / 企業資料處理人員]
- 體驗通道:
Introducing DocJev - a lightning-fast OSS library for document classification and splitting with jev ⚡️
— Jerry Liu (@jerryjliu0) September 20, 2026
Give a document alongside some natural language category rules. Jev will predict the document category (classify) or the boundaries between sub-documents (split).
It is 6x… pic.twitter.com/Nu5OOELDdD
Laya (OS Jev) — 開源社群 (mizeres / fordnox)
- 一言以蔽之:開源社群將意圖決策模型成功移植至 Apple MLX 與 CoreML 框架,實現本地端極速執行。
- 更新內容:可在 Mac M4 等裝置上透過 CoreML 離線執行,記憶體佔用小於 1GB,決策速度高達每秒 45 到 60 次,能以極低資源流暢運作貪吃蛇等即時控制場景。
- 適用人群:[本地 AI 愛好者 / 終端裝置開發者]
- 體驗通道:
So we already have an open source alternative similar to Jev... and 50x faster?!
— Paul Couvert (@itsPaulAi) September 20, 2026
Laya is an open source classification system:
- runs on less than 1GB memory
- available on hugging face
- can run on any laptop/phone
Quick example where it plays Snake at 60 decisions/sec!
BUT…
Flet 1.0 — Flet Team
- 更新內容:開源 Python 跨平臺應用框架 Flet 1.0 正式發布,宣佈可投入生產環境應用。基於 Flutter UI 渲染,透過
flet build一鍵支援 Android (apk/aab)、iOS (ipa)、Windows、macOS、Linux 與 Web 八大目標平臺,並可捆綁 Python 3.12 至 3.14。 - 適用人群:[Python 開發者 / 獨立創業者]
- 體驗通道:MarkTechPost 專文報導
產業動態
Anthropic 於舊金山灣區建立實體濕實驗室,正式進軍藥物研發
- 事件概述:據路透社獨家報導,Anthropic 已在舊金山灣區落成一間實體「濕實驗室」(Wet Lab),並將生命科學列為公司投入最大資源的方向之一。此前 Anthropic 已收購 Coefficient Bio 並延攬多位生化專家,目標透過 AI 攻克傳統藥企視為「不可成藥」的罕見疾病與複雜抗體設計。
- 影響分析:象徵前沿 AI 實驗室的角力已正式從純軟體延伸至物理世界與生化產業,同時也伴隨著高估值 IPO 前夕的戰略轉型壓力。
- 新聞連結:
Anthropic 悄悄建了一个生物实验室
— 宝玉 (@dotey) September 20, 2026
据路透社独家报道,Anthropic 已在旧金山湾区建成了一间湿实验室(wet lab,即可以进行真实生化实验的物理实验室),正式把 AI 的触角从软件延伸到药物研发。
Anthropic 生命科学负责人 Eric Kauderer-Abrams… pic.twitter.com/AfcvT2FmSX
三位安全研究人員利用 Claude Opus 5 在 72 小時內突破 OpenAI 內網
- 事件概述:資安團隊 Hacktron AI 披露了一起震撼業界的攻擊事件:他們利用影象解析庫
libheif的底層漏洞配合 Claude Opus 5 模型,成功將漏洞擴充套件為 OpenAI 員工的 SSO 帳戶接管,並透過 Codex 在 OpenAI 內部 Monorepo 成功提交了一份無害 Pull Request,整個過程耗時不到 72 小時。 - 影響分析:該事件凸顯了新一代前沿 AI Agent 在大幅降低漏洞利用門檻方面的強大破壞力,促使各大科技巨頭全面重新審視多服務串接與第三方函式庫的安全邊界。
- 新聞連結:
这件事值得重视:
— AI Will (@FinanceYF5) September 20, 2026
3 名安全研究人员使用 Claude Opus 5,将一个图片上传漏洞扩展为 OpenAI 员工账户接管。
随后,他们让被攻陷账户中的 Codex,在 OpenAI 内部 Monorepo 提交了一个 PR。
整个攻击的 Token 成本不到 3,000 美元。
Opus 4.8 一直难以完成利用,但 Opus 5… pic.twitter.com/VoHrsIA9vJ
黃仁勳公開反駁 AGI 毀滅論:AI 毀滅世界機率為 0%
- 事件概述:NVIDIA 執行長黃仁勳在接受 CBS 專訪時直言,AI 毀滅人類的機率為 0%,並批評部分同業(如 Anthropic 執行長 Dario Amodei 等)散佈生存恐慌是不必要且不負責任的行為,同時強調業界並不需要額外增加新的法規或指導方針。
- 影響分析:反映出晶片巨頭與部分前沿軟體實驗室在監管立場上的日益分歧,對美國聯邦政府未來 AI 政策的走向將產生直接影響。
- 新聞連結:The Verge 專訪報導
Politico 披露白宮與 Anthropic 圍繞安全監管的 85 天博弈內幕
- 事件概述:Politico 刊發深度調查,詳細還原了今年 4 月至 7 月間川普政府與 Anthropic 針對 Mythos 及 Fable 模型安全防護的 85 天激烈博弈,揭露了白宮官員一度因安全漏洞失控而考慮對高層採取法律行動的幕後秘辛。
- 影響分析:勾勒出了當前美國政府在「全力推動 AI 加速」與「防範前沿模型安全風險」之間的劇烈政策拉扯。
- 新聞連結:
Politico 今天刊发了一篇深度调查,采访十余位当事人,还原了今年 4 月到 7 月间,特朗普政府与 Anthropic 围绕 AI 安全监管展开的 85 天博弈。这段故事基本定义了美国当前对前沿 AI 模型的监管框架,尽管这个框架已经在被新模型甩在身后。
— 宝玉 (@dotey) September 20, 2026
Mythos 引爆危机
4 月 7 日,Anthropic… https://t.co/3kD27T6mvd
論文研究
τ^τ-bench:面向複雜真實客戶模擬的最新 Agent 評測基準 — Sierra & 普林斯頓大學
- 研究動機:傳統基準多著重於封閉式程式碼或單輪問答,無法有效考驗 AI Agent 在真實商業客服、多系統 API 呼叫與動態客戶需求交織環境下的綜合執行力。
- 核心創新:Sierra 與普林斯頓大學聯手推出 τ^τ-bench,要求 AI Agent 必須依據企業記錄、真實生產 API 與預算限制,完整交付可部署的客服代理專案。
- 研究成果:測試結果顯示,當前業界最強的編碼 AI Agent 在該真實模擬設定下的通關率僅有 23.9%,凸顯目前 Agent 距離完全自主商業交付仍有相當差距。
- 論文地址:
The best coding-agent setup passed only 23.9% of held-out customer simulations on this benchmark.
— Rohan Paul (@rohanpaul_ai) September 20, 2026
ττ-bench finds that today's coding agents fail most realistic agent-building work because they do not understand requirements deeply enough, so improving code generation alone will… pic.twitter.com/ddtE9MZND4
其他分享
大公司工程師爆料:全員依賴 Claude Code 生成程式碼卻無人閱讀 — Simon Willison / Voxium
- 內容簡介:知名安全專家 Simon Willison 轉發了一則引發熱議的職場爆料:某大型企業的一名新入職工程師發現,從 L1 到 L7 的工程師每天工作 12 到 13 小時,所有規格、程式碼、測試與報告全部由 Claude Code 自動生成,沒有任何人真正去閱讀產出內容,高層只盲目要求追求極致的產出速度。
- 傳送門:Simon Willison 深度整理

