GLM-5.3:Z.ai 的编程模型意外习得网络安全技能
GLM-5.2 之后的变化、对 AI 智能体真正重要的基准测试,以及开放权重为何分阶段发布

Z.ai 于 2026 年 8 月 14 日发布了 GLM-5.3,这次更新颇为罕见:基础模型与 GLM-5.2 完全相同,但编程和智能体相关指标却大幅跃升——而且模型还意外习得了一项网络安全技能,连官方团队都表示始料未及。以下是实际发生的变化、对 AI 智能体开发者真正重要的基准测试,以及开放权重尚未发布的原因。
GLM-5.3 是什么?
GLM-5.3 是 Z.ai GLM 系列的最新开放权重模型,定位为前沿编程与智能体模型。最关键的细节在于:它复用了与 GLM-5.2 相同的 7430 亿参数混合专家(MoE)基础架构,所有性能提升均来自大规模扩展的后训练,而非全新架构(MarkTechPost)。
简而言之,Z.ai 在更多、更多样化的任务环境中投入了更多算力对现有模型进行训练。这就是全部秘诀,对于追踪单靠后训练能将开放权重模型推进多远的研究者来说,这是一个很有价值的参考数据点。
GLM-5.3 相较 GLM-5.2 的改进
Z.ai 将这一方法称为环境扩展(environment scaling)。GLM-5.2 引入了训练框架;GLM-5.3 则在此基础上投入更多算力,让模型在规模更大的模拟专业工作环境中持续训练(Unite.AI)。
这些并非简单的编程练习题。举例来说,模型会被置于一个机器学习基础设施工程师的工作环境中——包含计算集群、内部文档、代码库和实验结果——并需要诊断性能瓶颈、实施修复方案,并交付可量化的性能提升。部分任务相当于一位经验丰富的工程师数天的工作量。为了大规模构建这些环境,Z.ai 使用研究智能体将真实工作模式转化为可运行的长周期任务环境,并配备一个评判智能体来验证每项任务确实可解。
这一方法的成效正如预期:任务周期越长,性能提升越显著。
GLM-5.3 编程基准测试
以下数据均为厂商自报数据,与 GLM-5.2 对比如下:
- Terminal-Bench 3.0: 4.6 → 28.3——在最长周期命令行基准测试上实现约 6 倍提升。
- DeepSWE v1.1: 46.2 → 66.9。
- Agents' Last Exam(CLI): 23.8 → 28.5。
- GDPval-AA v2(涵盖 44 个职业):得分 1,769。
在 Z.ai 内部 Code Bench 上,官方报告相较 GLM-5.2 提升约 50%,并有一项值得关注的效率数据:GLM-5.3 在每任务约 5 万输出 token 的条件下得分 31.4%,而 Claude Opus 4.8 使用 12 万 token 才达到 29.5%——以更少的 token 完成了更多工作。Claude Fable 5 在最大算力下仍以 39.5% 领跑该基准(MarkTechPost)。
需要坦诚说明的是:在公开测试集上,GLM-5.3 在若干较难的编程评测中仍落后于 GPT-5.6 Sol 和 Fable 5。此外,由于 Code Bench 是私有基准,其数据目前尚无法被独立复现。Z.ai 将其保密的理由是防止数据污染——公开测试集容易泄露进训练数据。
Z.ai 表示从未预料到的网络安全能力
这正是让 GLM-5.3 超越普通模型发布新闻的部分。Z.ai 在后训练中加入了漏洞发现数据,原本期望模型在推理单个漏洞方面有所提升。然而随着训练规模扩大,该能力持续累积增强,模型开始能够针对完整漏洞利用链制定连贯的攻击计划(SiliconRepublic)。
相关数据印证了这一说法,且规律依然成立——基准测试在漏洞利用链中的位置越深,性能提升越大:
- CyberGym(从白盒源码中发现并验证漏洞):77.2% → 84.5%,超越 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。
- ExploitBench(根因推理并生成可用漏洞利用代码):24.4% → 54.4%——超过 GLM-5.2 的两倍,但仍落后于 Mythos 5 的 78.0%。
- ExploitGym(在时间预算内完成任务):两小时内完成 105 项任务,六小时内完成 130 项——而 GLM-5.2 分别为 29 项和 39 项。
Z.ai 还表示,其模型已在实际部署环境中发现了真实漏洞:自 GLM-5.2 以来,已在 269 个开源项目中发现 2,436 个漏洞,其中 1,097 个被评定为严重或高危级别——涵盖内核、浏览器引擎和网络协议。该公司表示,其中最古老的漏洞可追溯至 1981 年。这些发现均汇入公开的安全披露账本,发布时已披露 53 个 CVE,另有 2,383 个仍处于保密期。
开放权重为何尚未发布
这是与 GLM-5.2 发布策略的重要差异。GLM-5.2 的权重在发布后数天内便上传至 Hugging Face。而 GLM-5.3 的权重采取分阶段发布策略:目前仅通过 Z.ai API、GLM Coding Plan 和 ZCode 提供访问,权重文件将在约两周后完成安全评估和加固后跟进发布(SiliconANGLE)。
原因直接与网络安全能力的涌现相关:Z.ai 正在对一个其公开承认已超预期发展出攻击性安全能力的模型进行加固。这是 GLM 系列首次因安全审查而推迟权重发布。
还有一项值得开发者关注的 API 层面变更:GLM-5.3 支持三种思考强度级别(低、高、最大),并且不再允许关闭思考模式——如果您的应用此前以关闭思考模式运行,这将是一项破坏性变更。
GLM-5.3 对 AI 智能体开发者意味着什么
几点实用建议:
- 长周期编程智能体是最佳应用场景。 性能提升集中在多步骤命令行操作和代码仓库级别的工作上——如代码重构、CI 故障排查、长时运行的智能体循环——而非单次补全任务。
- 效率与顶线分数同样重要。 在约 5 万 token 而非 12 万 token 的条件下完成相当水平的工作,对于全天候运行的智能体工作负载而言是实实在在的成本优势。
- 现在可以使用,但并非所有场景都适用。 初创公司可通过 Coding Plan 或 API 立即接入。有数据驻留或供应商审查要求的团队应等待权重发布后再行评估。
- 将厂商基准数据视为起点而非终点。 最引人注目的数字(内部 Code Bench、内置网络安全评分)尚未经过独立复现验证。预计于 2026 年 8 月底发布的权重文件,才是外部测试真正开始的时刻。
将 GLM-5.3 这样的模型融入您自己的 AI 工作团队
GLM-5.3 的故事本质上是关于长周期、智能体化工作的——让模型端到端地执行多步骤任务,而非仅仅回答单个提示词。这正是 Eigent 的设计初衷:一款开源、本地化的"Cowork"桌面应用,能够将此类模型转化为处理真实工作流的多智能体团队——从审查 GitHub PR 到运行您完全掌控的自托管 AI 编程智能体。自带模型,数据留在本地。立即下载 Eigent,开始构建您自己的智能体工作流。
Recent Posts

DeepSeek Harness:一切皆插件的开源 Agent 运行时
DeepSeek Harness v0.1 开发者预览版现已发布。这是一款基于 Cordis 构建的开源 MIT 许可 Agent 运行时,其中模型、工具、沙箱和 UI 均为插件。

Grok 4.6 能力解析与 AI 智能体实际应用场景
深入解析 Grok 4.6 的核心能力与应用场景:长时运行智能体、代码生成与视觉交互工作,以及如何在多智能体 AI 工作流中集成使用。

Grok 4.6 对比 Grok 4.5、GPT-5.6 Sol 与 Fable 5:究竟有何变化
Grok 4.6 对比 Grok 4.5、GPT-5.6 Sol 与 Fable 5:xAI 官方确认的内容、仍属推测的部分,以及这次仅限后训练升级必须跨越的真实基准门槛。