GLM-5.3-Flash:Z.ai 的多模态模型,价格仅为十分之一
GLM-5 系列首个原生多模态模型——320B-A18B 架构,MIT 许可,100 万 token 上下文,定价让全天候运行智能体成为可能

Z.ai 于 2026 年 8 月 26 日发布了 GLM-5.3-Flash——这是 GLM-5 系列中首个原生多模态模型,采用 MIT 许可发布,支持 100 万 token 上下文窗口(Z.ai on X)。该模型为 320B-A18B 架构,Z.ai 表示其在编程和智能体测试中全面超越 GLM-5.2,而价格仅为后者的约十分之一。以下是真正的新特性、对智能体而言重要的基准数据、定价信息,以及它与 GLM-5.3 的区别。
GLM-5.3-Flash 是什么?
GLM-5.3-Flash 是一个混合专家(Mixture-of-Experts,MoE)模型,每个 token 拥有 3200 亿总参数和 180 亿激活参数(TestingCatalog)。Z.ai 将其定位为 GLM-5 系列中成本更低、效率更高的层级:具备强大的编程和智能体性能,同时以低成本、快速响应为设计目标。
它与早期 GLM 版本有两点显著区别。其一,它是该系列首个原生多模态模型——视觉能力内嵌于训练过程,而非后期附加;其二,它以 MIT 许可发布,并在 Hugging Face 上开放权重。如果"Ox Alpha"这个名字听起来耳熟,那是因为这正是同一个模型:它在正式发布前约一周,以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上运行。
混合架构:在 100 万 token 下实现更低成本的注意力机制
效率优势源于注意力机制的设计。据 Z.ai 介绍,GLM-5.3-Flash 是首个将**稀疏注意力(sparse attention)与线性注意力(linear attention)**结合于同一混合架构的开源前沿模型——线性注意力处理局部依赖,稀疏注意力处理相关的全局上下文(Z.ai docs)。
这带来了切实的收益。与 GLM-5.3 相比,Z.ai 报告称注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍(TestingCatalog)。在上下文长度达到 100 万 token 时,Z.ai 称为 IndexPool 的组件会压缩索引键向量组,以控制延迟和内存占用。这使得 100 万 token 窗口在实际使用中切实可行,而不仅仅停留在规格表上——长周期智能体可以加载更多上下文,而不会导致成本急剧攀升。
该模型在 30 万亿 token 的多模态语料库上进行训练,Z.ai 表示其从全新训练的基础模型出发,而非复用 GLM-5.2 的基础——这与 GLM-5.3 的做法不同,后者复用了 GLM-5.2 的基础模型,仅在后训练阶段进行扩展。
GLM-5.3-Flash 基准测试
以下所有数据均来自厂商报告或第三方追踪机构;由于测试框架和设置各异,请将其视为方向性参考,而非严格的横向对比。
在编程和智能体测试套件上,与 GLM-5.2 相比,提升幅度显著(OfficeChai):
- DeepSWE v1.1: 46.2 → 63.4
- AutomationBench: 26.2 → 48.8(近乎翻倍)
- Terminal-Bench 2.1: 84.3——超越 DeepSeek-V4-Vision-Exp,与 Claude Opus 4.8 的 85.0 相差无几
在同一 Terminal-Bench 测试中,GPT-5.6 Terra(87.4)和 Gemini 3.7 Flash(85.8)仍略胜一筹,但差距已从 GLM-5.2 时代大幅缩小。在 Z.ai 内部的 Code Bench v1.0 测试中——在 Claude Code 环境下运行——GLM-5.3-Flash 在最大努力模式下达到 29.0,而 Opus 4.8 为 29.5,公司以此为据,表明其 Flash 层级模型在编程能力上已能与前沿模型一较高下。
在独立机构 Artificial Analysis 的 Intelligence Index 中,GLM-5.3-Flash 得分 57——在同价位推理模型中远高于中位数。需要坦诚说明的是:Code Bench 等内部基准无法独立复现,该模型也并未声称在最难的公开测试套件上超越 GPT-5.6 Sol 或 Fable 5。它是一个性价比之选,而非排行榜冠军。
原生多模态:视觉能力融入编程循环
多模态能力并非独立功能——它内嵌于模型的工作方式之中。Z.ai 训练 GLM-5.3-Flash 以检查渲染界面、游戏画面和 3D 输出,并根据视觉反馈评估和修正自身的工作(TestingCatalog)。
这种"查看结果,然后修正"的循环对构建 UI 或仪表盘的智能体至关重要:模型可以看到渲染后的页面,发现错误,并进行迭代。同样的方法还延伸至代码之外,涵盖文档、电子表格、演示文稿和会议材料——模型可以跨文本、图像和结构进行推理,并端到端交付完整的 PPTX、PDF、DOCX 和 XLSX 文件(Z.ai docs)。
GLM-5.3-Flash 的价格是多少?
定价是最大亮点。Z.ai 标准 API 费率为输入 $0.15/百万 token,输出 $0.50/百万 token,缓存输入为 $0.03(Z.ai on X)。第三方平台的报价更低——OpenRouter 显示为输入 $0.075/输出 $0.25(OpenRouter)。
对于 GLM Coding Plan 订阅用户,该模型已上线,可用配额为 GLM-5.3 的 3 倍(TestingCatalog)。这正是与高价层级的实际差异所在:你可以运行长时间的智能体循环,而无需时刻盯着 token 计量表。
GLM-5.3-Flash 与 GLM-5.3 的对比
两者为不同的任务而生。GLM-5.3 是重推理的编程模型——那个意外习得网络安全技能、权重经过安全审查分阶段发布的模型。GLM-5.3-Flash 则是高效、多模态、MIT 许可的变体,旨在以低成本大规模运行。
简要对比如下:
- 模态: GLM-5.3 以文本为主;GLM-5.3-Flash 原生支持多模态。
- 架构: GLM-5.3 复用 GLM-5.2 基础模型;GLM-5.3-Flash 采用全新训练的基础模型,结合稀疏注意力与线性注意力的混合架构。
- 效率: GLM-5.3-Flash 相比 GLM-5.3 注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍。
- 许可与权重: GLM-5.3-Flash 首日即以 MIT 许可发布并开放权重;GLM-5.3 的权重分阶段发布。
- 成本: GLM-5.3-Flash 面向大规模使用定价——据 Z.ai 称,约为 GLM-5.2 成本的十分之一。
如果你需要对复杂问题进行最深度的推理,GLM-5.3 是首选。如果你在运行多模态或长周期智能体,且每次任务的成本决定了工作流是否可行,那么 GLM-5.3-Flash 才是值得测试的选择。
对 AI 智能体开发者意味着什么
几点实用要点:
- 这是全天候智能体的成本杠杆。 以 $0.075–$0.15/百万输入 token 的价格配合真实的 100 万 token 窗口,GLM-5.3-Flash 让长时间运行的智能体循环变得经济可行,而这是前沿模型难以做到的。
- 多模态改变了智能体的验证方式。 能够看到渲染界面并加以修正的模型,闭合了纯文本智能体无法完成的循环——对 UI、仪表盘和文档工作尤为有用。
- MIT 许可消除了摩擦。 宽松许可下的开放权重意味着有数据驻留或供应商审查要求的团队可以从第一天起自行部署;本地部署支持 SGLang、vLLM 和 TokenSpeed。
- 将内部基准视为起点。 Code Bench 数据是私有且新鲜的。随着权重的公开,独立测试才刚刚开始。
在你自己的 AI 工作团队中运行 GLM-5.3-Flash 这样的模型
GLM-5.3-Flash 正是为 Eigent 所编排的工作而生:低成本、长周期、端到端运行的多模态智能体循环。Eigent 是一款开源本地"协作(Cowork)"桌面应用,能将此类模型转化为多智能体工作团队——从审查 GitHub PR 到运行你完全掌控的自托管 AI 编程智能体。携带你自己的模型,让工作留在你的机器上。立即下载 Eigent,构建你自己的智能体工作流。
Recent Posts

Cursor Origin:专为 AI 智能体打造的 Git 代码托管平台详解
Cursor Origin 是面向智能体时代的 Git 代码托管平台。了解早期测试版发布的内容、GitHub 镜像的工作原理、智能体的能力范围,以及目前仍存在的不足。

Slack Code:AI 编程智能体进入多人协作时代
Slack Code 将 AI 编程智能体引入共享频道,让团队共同规划、审查和交付代码。本文介绍代码频道的工作原理、适用人群及权衡取舍。

GLM-5.3:Z.ai 的编程模型意外习得网络安全技能
GLM-5.3 详解:Z.ai 开放权重模型在长周期编程任务上超越 GLM-5.2,意外获得网络安全能力,以及模型权重的发布时间表。