
GLM-5.3:程式開發與網路安全的新進展
隨著人工智慧(AI)技術的演進,模型發展重心已逐漸從單純堆疊參數量與擴大預訓練規模,轉向「後訓練(Post-training)」的極致優化。THUDM 團隊最新發布的 GLM-5.3 便是這一技術趨勢的代表性產物。它並非採用全新架構的基礎模型,而是直接沿用前代 GLM-5.2 的底座,完全透過在後訓練階段的擴展與強化學習(RL),顯著提升了處理複雜編程(Complex Coding)與超長任務鏈(Long-horizon Tasks)的能力。
圖片來源: GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
訓練策略的演變與 slime 框架
GLM-5.3 證明了在既有底座架構下,透過更豐富的任務環境與高質量的反饋/獎勵訊號,仍能極大程度地發掘模型的推理潛力。為了實現高效率的後訓練擴展,研發團隊整合了三項核心技術棧:
- IndexShare:專為高效率長文本處理設計的底層優化技術。
- SAO(帶有壓縮機制的強化學習算法):專門針對長程任務優化,防止模型在長時間推理中出現性能衰退。
- slime(大規模非同步訓練框架):這是整個強化學習擴展的骨幹。其採用「單一數據流」設計,將訓練側的 Megatron 與 Rollout 側的 SGLang 進行一體化整合。這使得數學、代碼、沙盒、驗證器以及長程 Agentic 環境能以「數據生成」的方式動態插入,而無須每次都重建訓練循環。
在過去一個月中,團隊在該技術棧上持續擴充:引入了更多元、更具真實性的工程任務環境,並投入了更龐大的 Rollout 算力。研發團隊甚至建構了自動化合成管道,能夠非同步合成出可執行、可驗證的長程環境,並透過雙向過濾機制(Solver 與 Judge 相互對抗)排除獎勵作弊,直接生成高可靠性的二元獎勵訊號進行直接強化訓練。
開發與 Agent 執行能力的躍升
在 Z.ai 開發團隊設計的 Z.ai Code Bench 本地模擬評測中,GLM-5.3 展現出極致的性能與 Token 消耗效率,性能較前代 GLM-5.2 提升了約 50%。
在真實的工程實踐中,GLM-5.3 在各類公開基準測試中均取得了頂尖成績:
- Terminal Bench 3.0:從前代的 4.6 分暴增至 28.3 分。
- DeepSWE v1.1:從 46.2% 提升至 66.9%。
- Agents’ Last Exam (ALE-CLI):提升至 28.5%。
思考深度與 Token 效率對比
GLM-5.3 引領了「花費更少 Token、達成更高準確度」的推理革命。在 Z.ai Code Bench 評測中:
- 在 Max 思考力度下,GLM-5.3 取得了 34.5% 的端到端任務完成率,而平均每項任務僅消耗約 7.5 萬個輸出 Token(對比 GLM-5.2 僅取得 23.4% 卻消耗高達 9.6 萬個 Token)。
- 在 High 思考力度下,GLM-5.3 取得了 31.4% 的成功率,平均僅消耗 5 萬個 Token,直接在效能與效率雙重維度上超越了 Claude Opus 4.8(29.5% 成功率,消耗 12 萬個 Token)。不過,其目前仍略遜於領先的閉源模型 Claude Fable 5(Max 思考下達 39.5%)。
對開發者而言,當任務涉及計算集群(Compute Clusters)、儲存架構、內部文檔與龐大遺留代碼庫(Legacy Codebases)的跨多日任務時,模型能主動在沙盒環境中進行反覆診斷、優化、實驗並提供可衡量的速度提升,真正具備了「端到端」獨立解決大中型工程任務的主動性。
網路安全與漏洞偵測的「湧現」能力
在後訓練的數據混合中,研發團隊有目的地加入了大量漏洞發現與安全環境數據。隨著強化學習規模的擴大,模型展現出了超出預期的湧現網路安全能力(Emergent Cyber Capability)。它不只能夠識別孤立的代碼缺陷,甚至開始學習理解複雜的多階段攻擊鏈(Exploitation Chains),並策劃出完整的防禦與利用方案。
目前,GLM-5.3 在各項網路安全與漏洞利用評測中,皆取得了領先成績:
- CyberGym:取得了 84.5% 的 SOTA 成績,超越了 Mythos 5(83.8%)與 GPT-5.6 Sol(83.6%)。
- ExploitBench:取得了 54.4% 的成績,相較於 GLM-5.2 的 24.4% 實現了翻倍增長。
- ExploitGym(時間歸一化預算測試):在 2 小時與 6 小時限制下,分別完成了 105 個 與 130 個 漏洞利用任務,大幅領先 GLM-5.2(29 / 39 個),儘管仍與閉源頂尖的 Mythos 5(181 / 247 個)存在一定差距。
Z.ai 漏洞披露分類帳(Security Disclosure Ledger)
研究團隊將 GLM-5.3 部署於真實世界的開源專案中進行深度審計與檢測,取得了驚人的成果:
- 成功在 269 個 開源專案中發現並確認了 2,436 個 潛在安全漏洞。
- 包含 1,097 個 嚴重與高危險性漏洞(Critical: 107 個,High: 990 個)。
- 這些漏洞橫跨系統內核、操作系統、瀏覽器引擎、網路協議與開源基礎設施。其中,最古老的漏洞竟在代碼庫中潛伏了長達 45 年(於 1981 年引入,平均漏洞潛伏壽命達 26.6 年)。
目前,這些發現已陸續提交修補,並在公共的 Z.ai Security Disclosure Ledger(漏洞披露分類帳)上進行持續動態更新與公開記錄,顯著提升了整個開源社群的數字防護安全。
常見問題與 API 遷移指引
Q:GLM-5.3 的 API 有何重大變更?
A:GLM-5.3 強制啟用思維推理功能,且其計費與調用格式有重要升級:
- 必須遷移
thinking.type:以往調用參數中的thinking.type: "disabled"已不再受支持。如果直接更新模型 ID 至glm-5.3,API 請求將直接失敗。 - 正確的請求範例:
必須將
thinking.type設置為"enabled",並通過reasoning_effort參數指定思考深度:{ "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "max" } - 三檔思考深度(Reasoning Effort):
low:輕量、快速,適合日常簡單代碼或文字任務。high:增強型邏輯,平衡響應速度與複雜度。max:深度思考(預設值),推薦在進行複雜架構設計、系統除錯與漏洞審計時使用。
Q:GLM Coding Plan 的點數扣減機制為何?
A:訂閱用戶已全面自動升級至 GLM-5.3,並採用更靈活的「點數配額系統(Points-based Quota System)」,點數會針對輸入 Token、緩存輸入 Token 以及輸出 Token 分開獨立計算。
- 50% 尖峰折扣優惠:在非尖峰時段(即週一至週五 14:00-18:00 UTC+8 以外的所有時段,以及週末兩天全天),模型調用僅消耗標準點數的 50%,非常適合自動化腳本非同步運行。
Q:什麼是 ZCode 智能體擴展?
A:透過官方開發套件 ZCode(https://zcode.z.ai),訂閱用戶可解鎖 GLM-5.3 的極致能力:
- 98%+ 緩存命中率:重複上下文採用緩存費率計費,使有效 token 額度提升約 30%。
- 目標模式(Goal Mode):開啟後,Agent 將自動進行「規劃-代碼編寫-本地測試-自動驗證」的閉環,不達目標誓不罷休。
- 遠端控制(Remote Control):支持通過手機微信(WeChat)或飛書(Feishu)實時監控、引導並終止伺服器上執行的長線開發與訓練任務。
Q:模型權重何時開放下載?
A:GLM-5.3 屬於開源權重模型。官方預計在產品發布後的 兩週內,在完成最終的安全評估與硬化(Hardening)測試後,正式將模型權重完全公開至 Hugging Face,屆時開發者可將其無縫整合至本機的 vLLM 或 SGLang 部署環境中。



