GLM-5.3:Z.ai 的編程模型意外習得網絡安全技能
GLM-5.2 的改進之處、對 AI 代理重要的基準測試,以及開放權重分階段發布的原因

Z.ai 於 2026 年 8 月 14 日發布了 GLM-5.3,這次更新有別於一般小版本迭代:基礎模型與 GLM-5.2 完全相同,但編程和代理任務的評分卻大幅提升——而且模型還習得了一項公司從未預期的網絡安全能力。以下是實際的改動內容、對 AI 代理開發者而言重要的基準測試,以及開放權重尚未發布的原因。
GLM-5.3 是什麼?
GLM-5.3 是 Z.ai GLM 系列的最新開放權重模型,定位為前沿編程與代理任務模型。最關鍵的細節是:它沿用了與 GLM-5.2 相同的 7430 億參數混合專家(Mixture-of-Experts)基礎架構,所有報告的性能提升均來自大規模擴展的後訓練(post-training),而非全新架構(MarkTechPost)。
簡而言之,Z.ai 投入更多算力,在更多、更多樣化的任務環境中訓練現有模型。這就是全部的方法,對於追蹤單靠後訓練能將開放權重模型推進多遠的研究者來說,這是一個很有參考價值的數據點。
GLM-5.3 相比 GLM-5.2 的改進
Z.ai 將這套方法稱為環境擴展(environment scaling)。GLM-5.2 建立了訓練框架;GLM-5.3 則投入更多算力,讓模型在規模更大的模擬專業工作環境中運行(Unite.AI)。
這些並非簡單的編程練習題。舉例來說,模型會被置於一位機器學習基礎架構工程師的工作環境中——包含計算集群、內部文檔、代碼庫和實驗結果——並需要診斷性能瓶頸、實施修復方案,並達到可量化的速度提升。部分任務相當於一位資深工程師數天的工作量。為了大規模構建這些環境,Z.ai 使用研究代理將真實工作模式轉化為可運行的長周期環境,並配備一個評判代理來驗證每項任務確實可解。
這套方法的成效正如預期:任務周期越長,提升幅度越大。
GLM-5.3 編程基準測試
以下數據均為廠商自報數據,與 GLM-5.2 相比:
- Terminal-Bench 3.0: 4.6 → 28.3 — 在最長周期 CLI 基準測試上提升約 6 倍。
- DeepSWE v1.1: 46.2 → 66.9。
- Agents' Last Exam(CLI): 23.8 → 28.5。
- GDPval-AA v2(涵蓋 44 個職業):得分 1,769。
在 Z.ai 內部 Code Bench 測試中,公司報告相比 GLM-5.2 提升約 50%,並有一項值得關注的效率表現:GLM-5.3 以每任務約 50,000 個輸出 token 達到 31.4% 的得分,而 Claude Opus 4.8 使用 120,000 個 token 才達到 29.5%——以更少的 token 完成更多工作。Claude Fable 5 在最大算力下仍以 39.5% 領先該基準測試(MarkTechPost)。
需要坦誠說明的是:在公開測試套件上,GLM-5.3 在多項較難的編程評估中仍落後於 GPT-5.6 Sol 和 Fable 5。由於 Code Bench 是私有基準測試,其數據目前尚無法獨立驗證。Z.ai 保持私有的理由是防止數據污染——公開測試集容易洩漏至訓練數據中。
Z.ai 表示從未預期的網絡安全能力
這正是讓 GLM-5.3 超越一般模型發布新聞的部分。Z.ai 在後訓練中加入了漏洞發現數據,原本預期模型能更好地推理單個漏洞。然而,隨著訓練規模擴大,這項能力持續累積增強,模型開始能夠針對完整的漏洞利用鏈制定連貫的攻擊計劃(SiliconRepublic)。
數據印證了這一說法,且規律依然成立——基準測試在漏洞利用鏈中的深度越深,提升幅度越大:
- CyberGym(從白盒源碼中發現並驗證漏洞):77.2% → 84.5%,略超 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
- ExploitBench(根因推理加上可運行的漏洞利用代碼):24.4% → 54.4% — 超過 GLM-5.2 的兩倍,但仍落後於 Mythos 5 的 78.0%。
- ExploitGym(在時間預算內完成的任務數):兩小時內完成 105 項任務,六小時內完成 130 項——而 GLM-5.2 分別為 29 項和 39 項。
Z.ai 還表示,其模型已在實際部署環境中發現真實漏洞:自 GLM-5.2 以來,已在 269 個開源項目中發現 2,436 個漏洞,其中 1,097 個被評定為嚴重或高危級別——涵蓋內核、瀏覽器引擎和網絡協議。公司表示,最古老的漏洞可追溯至 1981 年。這些發現匯入了一個公開的安全披露賬本,發布時已披露 53 個 CVE,另有 2,383 個仍在禁止披露期內。
開放權重尚未發布的原因
這是與 GLM-5.2 發布策略的重要差異。GLM-5.2 的模型權重在發布後數天內便上架 Hugging Face。GLM-5.3 的權重則採取分階段發布:目前僅通過 Z.ai API、GLM Coding Plan 和 ZCode 提供,模型權重將在約兩週後完成安全評估和加固工作後跟進發布(SiliconANGLE)。
原因直接與網絡安全能力的結果相關:Z.ai 正在對一個其公開承認已超預期發展出攻擊性安全能力的模型進行加固。這是 GLM 系列首次因安全審查而推遲發布。
另有一項值得開發者注意的 API 層面變更:GLM-5.3 支持三種思考強度級別(低、高、最大),並且不再允許關閉思考功能——如果你的應用此前以關閉思考模式運行,這將是一項破壞性變更。
GLM-5.3 對 AI 代理開發者的意義
幾點實用要點:
- 長周期編程代理是最佳應用場景。 性能提升集中在多步驟 CLI 和代碼庫規模的工作上——如代碼重構、CI 問題分類、長時間運行的代理循環——而非一次性補全任務。
- 效率與頂線分數同樣重要。 以約 5 萬個 token 完成相當的工作量(而非 12 萬個)是代理工作負載全天運行時的真實成本優勢。
- 現在可以使用,但並非所有場景都適用。 初創公司現在可通過 Coding Plan 或 API 採用。有數據駐留或供應商審查要求的團隊應等待模型權重發布。
- 將廠商基準測試視為起點。 最引人注目的數字(內部 Code Bench、測試框架內的網絡安全得分)尚未經過獨立驗證。預計於 2026 年 8 月底發布的模型權重,才是外部測試的真正開始。
將 GLM-5.3 這類模型應用於你自己的 AI 工作團隊
GLM-5.3 的故事本質上是關於長周期代理任務的——讓模型端到端地執行多步驟任務,而非僅回應單一提示。這正是 Eigent 的設計初衷:一款開源的本地「Cowork」桌面應用,能將這類模型轉化為處理真實工作流程的多代理工作團隊——從審查 GitHub PR 到運行你完全掌控的自托管 AI 編程代理。自帶模型,數據留在本地。立即下載 Eigent,開始構建你自己的代理工作流程。
Recent Posts

DeepSeek Harness:一切皆插件的開源 Agent 運行時
DeepSeek Harness v0.1 現已進入開發者預覽階段。這是一個基於 Cordis 構建的開源 MIT 授權 agent 運行時,其中模型、工具、沙盒及 UI 均為插件。

Grok 4.6 的功能與 AI 代理的實際應用場景
深入了解 Grok 4.6 的功能與應用場景:長時間運行的代理、編程及視覺化工作,以及如何在多代理 AI 工作團隊中使用它。

Grok 4.6 對比 Grok 4.5、GPT-5.6 Sol 及 Fable 5:實際有何改變
Grok 4.6 對比 Grok 4.5、GPT-5.6 Sol 及 Fable 5:xAI 實際確認的內容、仍屬推測的部分,以及這次純後訓練升級必須跨越的真實基準門檻。