logo
  • 环境
  • 企业版
  • 价格
Blogs
Aug 26, 2026

GLM-5.3-Flash:Z.ai 的多模态模型,价格仅为十分之一

GLM-5 系列首个原生多模态模型——320B-A18B 架构,MIT 许可,100 万 token 上下文,定价让全天候运行智能体成为可能

EigentEigent
Share to
GLM-5.3-Flash:Z.ai 的多模态模型,价格仅为十分之一
  • GLM-5.3-Flash 是什么?
  • 混合架构:在 100 万 token 下实现更低成本的注意力机制
  • GLM-5.3-Flash 基准测试
  • 原生多模态:视觉能力融入编程循环
  • GLM-5.3-Flash 的价格是多少?
  • GLM-5.3-Flash 与 GLM-5.3 的对比
  • 对 AI 智能体开发者意味着什么
  • 在你自己的 AI 工作团队中运行 GLM-5.3-Flash 这样的模型
Automate Everything with
AI Workforce on Desktop
Download Eigent

Z.ai 于 2026 年 8 月 26 日发布了 GLM-5.3-Flash——这是 GLM-5 系列中首个原生多模态模型,采用 MIT 许可发布,支持 100 万 token 上下文窗口(Z.ai on X)。该模型为 320B-A18B 架构,Z.ai 表示其在编程和智能体测试中全面超越 GLM-5.2,而价格仅为后者的约十分之一。以下是真正的新特性、对智能体而言重要的基准数据、定价信息,以及它与 GLM-5.3 的区别。

GLM-5.3-Flash 是什么?

GLM-5.3-Flash 是一个混合专家(Mixture-of-Experts,MoE)模型,每个 token 拥有 3200 亿总参数和 180 亿激活参数(TestingCatalog)。Z.ai 将其定位为 GLM-5 系列中成本更低、效率更高的层级:具备强大的编程和智能体性能,同时以低成本、快速响应为设计目标。

它与早期 GLM 版本有两点显著区别。其一,它是该系列首个原生多模态模型——视觉能力内嵌于训练过程,而非后期附加;其二,它以 MIT 许可发布,并在 Hugging Face 上开放权重。如果"Ox Alpha"这个名字听起来耳熟,那是因为这正是同一个模型:它在正式发布前约一周,以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上运行。

混合架构:在 100 万 token 下实现更低成本的注意力机制

效率优势源于注意力机制的设计。据 Z.ai 介绍,GLM-5.3-Flash 是首个将**稀疏注意力(sparse attention)与线性注意力(linear attention)**结合于同一混合架构的开源前沿模型——线性注意力处理局部依赖,稀疏注意力处理相关的全局上下文(Z.ai docs)。

这带来了切实的收益。与 GLM-5.3 相比,Z.ai 报告称注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍(TestingCatalog)。在上下文长度达到 100 万 token 时,Z.ai 称为 IndexPool 的组件会压缩索引键向量组,以控制延迟和内存占用。这使得 100 万 token 窗口在实际使用中切实可行,而不仅仅停留在规格表上——长周期智能体可以加载更多上下文,而不会导致成本急剧攀升。

该模型在 30 万亿 token 的多模态语料库上进行训练,Z.ai 表示其从全新训练的基础模型出发,而非复用 GLM-5.2 的基础——这与 GLM-5.3 的做法不同,后者复用了 GLM-5.2 的基础模型,仅在后训练阶段进行扩展。

GLM-5.3-Flash 基准测试

以下所有数据均来自厂商报告或第三方追踪机构;由于测试框架和设置各异,请将其视为方向性参考,而非严格的横向对比。

在编程和智能体测试套件上,与 GLM-5.2 相比,提升幅度显著(OfficeChai):

  • DeepSWE v1.1: 46.2 → 63.4
  • AutomationBench: 26.2 → 48.8(近乎翻倍)
  • Terminal-Bench 2.1: 84.3——超越 DeepSeek-V4-Vision-Exp,与 Claude Opus 4.8 的 85.0 相差无几

在同一 Terminal-Bench 测试中,GPT-5.6 Terra(87.4)和 Gemini 3.7 Flash(85.8)仍略胜一筹,但差距已从 GLM-5.2 时代大幅缩小。在 Z.ai 内部的 Code Bench v1.0 测试中——在 Claude Code 环境下运行——GLM-5.3-Flash 在最大努力模式下达到 29.0,而 Opus 4.8 为 29.5,公司以此为据,表明其 Flash 层级模型在编程能力上已能与前沿模型一较高下。

在独立机构 Artificial Analysis 的 Intelligence Index 中,GLM-5.3-Flash 得分 57——在同价位推理模型中远高于中位数。需要坦诚说明的是:Code Bench 等内部基准无法独立复现,该模型也并未声称在最难的公开测试套件上超越 GPT-5.6 Sol 或 Fable 5。它是一个性价比之选,而非排行榜冠军。

原生多模态:视觉能力融入编程循环

多模态能力并非独立功能——它内嵌于模型的工作方式之中。Z.ai 训练 GLM-5.3-Flash 以检查渲染界面、游戏画面和 3D 输出,并根据视觉反馈评估和修正自身的工作(TestingCatalog)。

这种"查看结果,然后修正"的循环对构建 UI 或仪表盘的智能体至关重要:模型可以看到渲染后的页面,发现错误,并进行迭代。同样的方法还延伸至代码之外,涵盖文档、电子表格、演示文稿和会议材料——模型可以跨文本、图像和结构进行推理,并端到端交付完整的 PPTX、PDF、DOCX 和 XLSX 文件(Z.ai docs)。

GLM-5.3-Flash 的价格是多少?

定价是最大亮点。Z.ai 标准 API 费率为输入 $0.15/百万 token,输出 $0.50/百万 token,缓存输入为 $0.03(Z.ai on X)。第三方平台的报价更低——OpenRouter 显示为输入 $0.075/输出 $0.25(OpenRouter)。

对于 GLM Coding Plan 订阅用户,该模型已上线,可用配额为 GLM-5.3 的 3 倍(TestingCatalog)。这正是与高价层级的实际差异所在:你可以运行长时间的智能体循环,而无需时刻盯着 token 计量表。

GLM-5.3-Flash 与 GLM-5.3 的对比

两者为不同的任务而生。GLM-5.3 是重推理的编程模型——那个意外习得网络安全技能、权重经过安全审查分阶段发布的模型。GLM-5.3-Flash 则是高效、多模态、MIT 许可的变体,旨在以低成本大规模运行。

简要对比如下:

  • 模态: GLM-5.3 以文本为主;GLM-5.3-Flash 原生支持多模态。
  • 架构: GLM-5.3 复用 GLM-5.2 基础模型;GLM-5.3-Flash 采用全新训练的基础模型,结合稀疏注意力与线性注意力的混合架构。
  • 效率: GLM-5.3-Flash 相比 GLM-5.3 注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍。
  • 许可与权重: GLM-5.3-Flash 首日即以 MIT 许可发布并开放权重;GLM-5.3 的权重分阶段发布。
  • 成本: GLM-5.3-Flash 面向大规模使用定价——据 Z.ai 称,约为 GLM-5.2 成本的十分之一。

如果你需要对复杂问题进行最深度的推理,GLM-5.3 是首选。如果你在运行多模态或长周期智能体,且每次任务的成本决定了工作流是否可行,那么 GLM-5.3-Flash 才是值得测试的选择。

对 AI 智能体开发者意味着什么

几点实用要点:

  • 这是全天候智能体的成本杠杆。 以 $0.075–$0.15/百万输入 token 的价格配合真实的 100 万 token 窗口,GLM-5.3-Flash 让长时间运行的智能体循环变得经济可行,而这是前沿模型难以做到的。
  • 多模态改变了智能体的验证方式。 能够看到渲染界面并加以修正的模型,闭合了纯文本智能体无法完成的循环——对 UI、仪表盘和文档工作尤为有用。
  • MIT 许可消除了摩擦。 宽松许可下的开放权重意味着有数据驻留或供应商审查要求的团队可以从第一天起自行部署;本地部署支持 SGLang、vLLM 和 TokenSpeed。
  • 将内部基准视为起点。 Code Bench 数据是私有且新鲜的。随着权重的公开,独立测试才刚刚开始。

在你自己的 AI 工作团队中运行 GLM-5.3-Flash 这样的模型

GLM-5.3-Flash 正是为 Eigent 所编排的工作而生:低成本、长周期、端到端运行的多模态智能体循环。Eigent 是一款开源本地"协作(Cowork)"桌面应用,能将此类模型转化为多智能体工作团队——从审查 GitHub PR 到运行你完全掌控的自托管 AI 编程智能体。携带你自己的模型,让工作留在你的机器上。立即下载 Eigent,构建你自己的智能体工作流。

Recent Posts

可移植的 Agent 记忆:在 Claude Code、Cursor、Codex 和 Gemini 之间携带上下文
Oct 6, 2026

可移植的 Agent 记忆:在 Claude Code、Cursor、Codex 和 Gemini 之间携带上下文

了解可移植 Agent 记忆如何在 Claude Code、Cursor、Codex 和 Gemini 之间传递上下文,探索其背后的实现方案,以及如何避免供应商锁定。

EigentEigent
Gemini 4 Argon:新特性、基准测试与定价
Oct 2, 2026

Gemini 4 Argon:新特性、基准测试与定价

Gemini 4 Argon 是 Google 面向长周期任务的前沿模型。了解新特性、基准测试、定价、100万输出 token 上限以及优先访问权限。

EigentEigent
Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
产品Sep 25, 2026

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews

Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

感谢订阅!

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们帮助中心使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD