GLM-5.3:Z.ai 的程式碼模型意外習得網路安全技能
GLM-5.3 相較 GLM-5.2 的改進、對 AI 代理重要的基準測試,以及為何開放權重採分階段發布

Z.ai 於 2026 年 8 月 14 日發布 GLM-5.3,這次更新有個不尋常之處:基礎模型與 GLM-5.2 完全相同,但程式碼能力與代理任務的評測數字卻大幅躍升——而且模型還意外習得了一項網路安全技能,連開發團隊都坦言始料未及。以下將說明實際改變了什麼、對 AI 代理開發者重要的基準測試,以及為何開放權重尚未釋出。
GLM-5.3 是什麼?
GLM-5.3 是 Z.ai GLM 系列的最新開放權重模型,定位為前沿程式碼與代理任務模型。最關鍵的細節是:它沿用與 GLM-5.2 相同的 7430 億參數混合專家(Mixture-of-Experts)基礎架構,所有報告中的進步均來自規模更大的後訓練(post-training),而非全新架構(MarkTechPost)。
簡單來說,Z.ai 投入更多算力,在更多、更多元的任務環境中訓練現有模型。這就是全部的秘訣,對於追蹤「單靠後訓練能將開放權重模型推進多遠」的研究者而言,這是一個很有參考價值的數據點。
GLM-5.3 相較 GLM-5.2 的改進
Z.ai 將這套方法稱為環境擴展(environment scaling)。GLM-5.2 建立了訓練框架;GLM-5.3 則投入更多算力,讓模型在規模大得多的模擬專業工作環境中反覆訓練(Unite.AI)。
這些並非簡單的程式碼謎題。舉例來說,模型會被置入一位 ML 基礎架構工程師的工作環境中——包含運算叢集、內部文件、程式碼庫與實驗結果——並需要診斷效能瓶頸、實作修復方案,並達成可量化的速度提升。部分任務相當於一位資深工程師數天的工作量。為了大量生產這類任務,Z.ai 使用研究代理將真實工作模式轉化為可執行的長時程環境,並搭配一個評審代理驗證每項任務確實可解。
這套方法的成效正如預期:任務時程越長,進步幅度越大。
GLM-5.3 程式碼基準測試
以下數據均為廠商自行回報,與 GLM-5.2 相比:
- Terminal-Bench 3.0: 4.6 → 28.3——在最長時程 CLI 基準測試上提升約 6 倍。
- DeepSWE v1.1: 46.2 → 66.9。
- Agents' Last Exam(CLI): 23.8 → 28.5。
- GDPval-AA v2(涵蓋 44 種職業):得分 1,769。
在 Z.ai 內部的 Code Bench 上,該公司回報較 GLM-5.2 提升約 50%,並有一項值得關注的效率表現:GLM-5.3 以每任務約 50,000 個輸出 token 達到 31.4% 的得分,而 Claude Opus 4.8 使用 120,000 個 token 才達到 29.5%——以更少的 token 完成更多工作。Claude Fable 5 在最大努力模式下仍以 39.5% 領先該基準測試(MarkTechPost)。
需要誠實說明的是:在公開測試套件上,GLM-5.3 在幾項較難的程式碼評測中仍落後於 GPT-5.6 Sol 和 Fable 5。此外,由於 Code Bench 是私有基準測試,其數字目前無法被獨立驗證。Z.ai 選擇保密的理由是防止資料污染——公開測試集容易洩漏進訓練資料。
Z.ai 坦言未曾預料的網路安全能力
這正是讓 GLM-5.3 超越一般模型發布新聞的部分。Z.ai 在後訓練中加入漏洞發現資料,原本預期模型能更擅長推理個別漏洞。然而隨著訓練規模擴大,能力持續累積,模型開始能夠針對**完整的漏洞利用鏈(exploitation chain)**形成連貫的攻擊計畫(SiliconRepublic)。
數字印證了這項說法,且同樣的規律再次出現——基準測試在漏洞利用鏈中的位置越深,進步幅度越大:
- CyberGym(從白箱原始碼中找出並驗證漏洞):77.2% → 84.5%,略超 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
- ExploitBench(根本原因推理加上可運作的漏洞利用程式):24.4% → 54.4%——超過 GLM-5.2 的兩倍,但仍落後 Mythos 5 的 78.0%。
- ExploitGym(在時間預算內完成的任務數):兩小時內完成 105 項任務,六小時內完成 130 項——GLM-5.2 分別為 29 和 39 項。
Z.ai 也表示,其模型已在真實部署環境中發現實際漏洞:自 GLM-5.2 以來,已在 269 個開源專案中發現 2,436 個漏洞,其中 1,097 個被評為嚴重或高危等級——涵蓋核心(kernel)、瀏覽器引擎與網路協定。該公司表示,最古老的漏洞可追溯至 1981 年。這些發現匯入了一個公開的安全揭露帳本(Security Disclosure Ledger),發布時已公開 53 個 CVE,另有 2,383 個仍在保密期(embargo)中。
為何開放權重尚未釋出
這是與 GLM-5.2 做法的一大差異。GLM-5.2 的權重在發布後數天內即上架 Hugging Face。GLM-5.3 的權重則採分階段發布:目前僅透過 Z.ai API、GLM Coding Plan 和 ZCode 提供,權重預計在約兩週後完成安全評估與強化後才會跟進(SiliconANGLE)。
原因直接與網路安全能力的結果相關:Z.ai 正在對一個他們公開承認其攻擊性安全能力發展速度超乎預期的模型進行強化。這是 GLM 系列首次明確因安全審查而延遲發布。
對開發者而言,還有一項 API 層面的重要變更:GLM-5.3 支援三種思考強度等級(低、高、最大),且不再允許關閉思考功能——若您的應用程式先前以關閉思考的方式運行,這將是一項破壞性變更(breaking change)。
GLM-5.3 對 AI 代理開發者的意義
幾點實際建議:
- 長時程程式碼代理是最佳應用場景。 進步最集中在多步驟 CLI 和倉庫規模的工作上——重構、CI 分類、長時間運行的代理迴圈——而非一次性的程式碼補全。
- 效率與頂線分數同樣重要。 以約 5 萬個 token 完成相當的工作,而非 12 萬個,對全天運行的代理工作負載而言是真實的成本優勢。
- 現在可以使用,但並非所有場景都適用。 新創公司可透過 Coding Plan 或 API 立即採用。有資料駐留(data-residency)或廠商審查規定的團隊應等待權重釋出。
- 將廠商基準測試視為起點。 最引人注目的數字(內部 Code Bench、測試框架內的網路安全分數)尚未經過獨立驗證。預計於 2026 年 8 月底釋出的權重,才是外部測試的真正起點。
將 GLM-5.3 這類模型應用於您自己的 AI 工作團隊
GLM-5.3 的故事本質上是關於長時程、代理式工作——讓模型端對端執行多步驟任務,而非只回答單一提示。這正是 Eigent 的設計初衷:一款開源、本地端的「Cowork」桌面應用程式,能將這類模型轉化為處理真實工作流程的多代理工作團隊——從審查 GitHub PR 到運行您完全掌控的自架 AI 程式碼代理。自帶模型,工作留在您的機器上。立即下載 Eigent,開始建立您自己的代理工作流程。
Recent Posts

DeepSeek Harness:一切皆插件的開源 Agent 執行環境
DeepSeek Harness v0.1 現已進入開發者預覽階段。這是一款基於 Cordis 架構的開源 MIT 授權 Agent 執行環境,其中模型、工具、沙箱與 UI 介面均以插件形式實現。

Grok 4.6 功能與 AI 代理的實際應用場景
深入了解 Grok 4.6 的功能與應用場景:長時間運行的代理、程式開發與視覺化工作,以及如何在多代理 AI 工作團隊中使用它。

Grok 4.6 vs Grok 4.5、GPT-5.6 Sol 與 Fable 5:實際有哪些改變
Grok 4.6 vs Grok 4.5、GPT-5.6 Sol 與 Fable 5:xAI 實際確認的內容、仍屬推測的部分,以及這次純後訓練升級必須跨越的真實基準門檻。