AI 日報|GLM-5.3 與騰訊 Hy4 預覽版重磅開源,Anthropic 自主對齊研究突破,Grok Bot 支援網購與 Stripe 支付
模型發布/更新
GLM-5.3 系列模型 — Z.ai
一言以蔽之:Z.ai 正式開源旗艦模型 GLM-5.3 及其輕量高效版 GLM-5.3-Flash,專為複雜軟體工程與網路防禦打造,全面支援 1M 超長上下文。
核心亮點:
在程式碼編譯、網安任務與長時程 AI Agent 工作負載上展現頂尖效能。
支援 OpenRouter 與各大 API 平臺,其中 GLM-5.3-Flash 以極高價效比在開源社群引發熱烈關注。
技術規格:開源權重 (Open-weight) / 1M 上下文 / 支援智慧代理與資安任務
傳送門:
GLM-5.3 is now open-weight.
— Z.ai (@Zai_org) August 28, 2026
Our most capable model for agentic coding and cyber defense is now available to download, run, and customize.
Weights: https://t.co/v1IbWMXxg4
Tech blog: https://t.co/ekQkO83jCv pic.twitter.com/f8XlJksKyf
Hy4 Preview — 騰訊混元 (Tencent Hunyuan)
一言以蔽之:騰訊混元重磅推出新一代旗艦模型 Hy4 Preview,採用混合專家 (MoE) 架構並解鎖 1M 上下文視窗。
核心亮點:
總引數達 770B、啟用引數 49B,在軟體工程、金融分析與遊戲開發等真實生產力任務中表現亮眼。
已在騰訊雲 TokenHub、OpenRouter 及 Vercel AI Gateway 同步上線。
技術規格:770B 總引數 / 49B 啟用 / 1M 上下文 / 開源預覽
傳送門:騰訊混元官方說明
Qwen3.8-Flash — 阿里雲 Qwen
一言以蔽之:阿里雲發布 Qwen3.8-Flash 多模態模型,主打輕量高效與 1M 上下文支援,全面登陸 OpenCode Go。
核心亮點:
具備 125B 總引數、6B 啟動引數的平衡架構,兼顧推理速度與多模態處理能力。
在多個開發平臺與工具中同步支援,大幅降低開發者的工程呼叫成本。
技術規格:125B/6B 引數 / 1M 上下文 / 多模態
傳送門:
125B/6B, 1M context, multimodal, now in OpenCode Go. ⚡ Happy coding with Qwen3.8-Flash! https://t.co/hHp1TdSEU6
— Qwen (@Alibaba_Qwen) August 28, 2026
產品發布/更新
Grok Bot 支援 Link 與 Stripe 支付:開啟 AI 自主網路購物新時代 — xAI
- 更新內容:xAI 為 Grok Bot 推出重大功能更新,支援繫結 Link 與 Stripe 帳戶,讓 AI 代理能夠在使用者授權與審核下,安全地在網路上代為完成購物與各類交易。
- 適用人群:[一般大眾 / 效率工具重度使用者 / 網購族群]
- 體驗通道:
Grok Bot can now be linked to a Link account so it can buy things for you online.
— 🚨 AI News | TestingCatalog (@testingcatalog) August 28, 2026
> All transactions still require approval.
> Only available in the US 👀 https://t.co/9XhY6iFOkw pic.twitter.com/YqHyfrHuee
Rosalind Workbench 研究預覽版 — OpenAI
- 更新內容:OpenAI 正式推出 Rosalind Workbench,將科學問題與基因組學、蛋白質結構分析等專門模型及工具無縫串聯在單一工作流中,提升科學研究效率。
- 適用人群:[科學研究員 / 生物資訊工程師 / 開發者]
- 體驗通道:
Rosalind Workbench connects scientific questions to specialized models, tools, and reviewable outputs in one workflow, from protein structure and sequence analysis to sequencing pipelines.https://t.co/03b2Q4gfaF
— OpenAI Developers (@OpenAIDevs) August 28, 2026
產業動態
美國聯邦法院裁定:川普政府將 Anthropic 列入黑名單違法
- 事件概述:美國加州北區聯邦地區法院法官 Rita Lin 正式裁定,川普政府此前將 Anthropic 列為國家安全供應鏈風險並禁止其 AI 技術使用的行為違法,構成對第一修正案的非法報複。
- 影響分析:此項判決保障了 AI 企業在拒絕放棄產品安全與倫理限制(如反對致命自主武器及大規模監控)時的法律權益,對未來 AI 政策監管與政府採購具重大指標意義。
- 新聞連結:Ars Technica 報導
AI 雲端服務商 Lambda 獲 10 億美元債務融資以採購輝達晶片
- 事件概述:AI 雲端新創 Lambda 透過摩根大通安排的私人短期債務融資籌集 10 億美元,用於採購並部署微軟租賃所需的輝達 AI 晶片。
- 影響分析:反映出全球 AI 基礎設施算力軍備競賽持續白熱化,雲端服務商正透過巨額融資快速擴充高階 GPU 叢集以應對暴增的推理需求。
- 新聞連結:TechCrunch 報導
論文研究
Automated Researchers Mitigate Alignment Failures — Anthropic
- 研究動機:探討能否利用成熟大模型自動化進行對齊研究,以解決傳統人工對齊速度慢、成本高昂且難以應對隱蔽對齊失敗的難題。
- 核心創新:研究團隊讓 Claude 自主提出研究方法並訓練模型,成功在 10 個對齊基準上顯著提升模型表現,甚至在欺騙場景中超越多位人類專家。
- 研究成果:證明瞭 AI 自主進行安全對齊與自我改進的可行性,大幅縮小了安全差距且不損害通用模型能力。
- 論文地址:Anthropic 官方研究報告
WikiSkills: Maintaining Agent Skills Through Persistent Knowledge — Google DeepMind / Google
- 研究動機:傳統 AI 智慧代理在演化技能時容易將執行軌跡與累積知識混為一談,導致跨任務泛化能力不足。
- 核心創新:提出將原始執行軌跡、累積知識持久化的 Wiki 以及可執行技能三者徹底解耦,讓後續的技能更新基於穩定知識庫而非雜亂的最佳化歷史。
- 研究成果:消融實驗表明,擁有持久化知識 Wiki 的小模型表現可超越缺乏此機制的實體大模型,且技能可在不同模型家族間有效遷移。
- 論文地址:
A great paper from Google on maintaining agent skills through persistent knowledge. https://t.co/jmtXNRyJap
— elvis (@omarsar0) August 28, 2026
Co-Scientist 邁向真實世界實驗:材料科學與生物學的突破 — Google DeepMind
- 研究動機:將 AI 科學家從純模擬模擬推進至真實世界的實驗室自動化操作,解決複雜材料合成與生物學預測的難題。
- 核心創新:結合具備盲審機制的推理時間擴放架構,驅動化學氣相沉積反應器與多模態生物資料預測,並透過可靠性模組降低幻覺。
- 研究成果:在 HealthBench Hard 上超越多個前沿模型,並成功在數分鐘內單次合成出高品質的 2D 材料(如 MoS2)與預測大腸桿菌群聚表型。
- 論文地址:
Impressive new paper from Google DeepMind.
— elvis (@omarsar0) August 28, 2026
(bookmark it)
It takes Co-Scientist out of simulation and into real-world experiments.
A summary of the results:
In computer science, it found an inference-time scaling architecture that beat six frontier models on HealthBench Hard… pic.twitter.com/5Znqf4A5cZ
其他分享
OpenRouter 資料揭示:傑文斯悖論在大模型降價下的真實體現
- 內容簡介:OpenRouter 發布的最新資料顯示,當 GPT-5.6 Terra 和 Luna 等高階模型大幅降價與提供折扣時,其 Token 總消耗量不降反增,飆升了高達 13.8 倍。這完美印證了經濟學上的傑文斯悖論(Jevons Paradox)——當技術使資源使用更高效時,該資源的總消耗量反而會大幅增加。
- 傳送門:
What happened when GPT 5.6 Terra and Luna were heavily discounted on OpenRouter?
— OpenRouter (@OpenRouter) August 28, 2026
Token usage exploded by 13.8x
Jevons Paradox = as technology makes the use of a resource more efficient, total consumption of that resource increases rather than decreases 🧵 pic.twitter.com/5rPiufYhGz



