GLM-5.3-Flash:Z.ai 的多模態模型,售價僅為十分之一
GLM-5 系列首個原生多模態模型——320B-A18B 架構、MIT 授權、100 萬 token 上下文,定價讓代理全天運行成為可能

Z.ai 於 2026 年 8 月 26 日正式發布 GLM-5.3-Flash——這是其 GLM-5 系列中首個原生多模態模型,採用 MIT 授權發布,並提供 100 萬 token 的上下文視窗(Z.ai on X)。這是一個 320B-A18B 模型,Z.ai 表示其在編程及代理測試中的表現超越 GLM-5.2,而售價僅約為後者的十分之一。以下將介紹真正的新功能、對代理而言重要的基準測試、定價,以及它與 GLM-5.3 的區別。
什麼是 GLM-5.3-Flash?
GLM-5.3-Flash 是一個混合專家(Mixture-of-Experts)模型,每個 token 擁有 3200 億總參數及 180 億活躍參數(TestingCatalog)。Z.ai 將其定位為 GLM-5 系列中成本較低、效率較高的層級:具備強大的編程及代理性能,同時以低成本、快速響應為設計目標。
它與早期 GLM 版本有兩大區別。它是該系列中首個原生多模態模型——視覺能力內建於訓練過程,而非後期附加——並以 MIT 授權發布,開放權重可在 Hugging Face 上取得。如果「Ox Alpha」這個名字聽起來很熟悉,那是因為這正是同一個模型:它在正式發布前約一週,以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上運行。
混合架構:在 100 萬 token 下實現更低成本的注意力機制
效率優勢源於注意力機制的設計。據 Z.ai 介紹,GLM-5.3-Flash 是首個將**稀疏注意力(sparse attention)與線性注意力(linear attention)**結合於單一混合架構的開源前沿模型——線性注意力處理局部依賴,稀疏注意力處理相關的全局上下文(Z.ai docs)。
這帶來了具體的成效。與 GLM-5.3 相比,Z.ai 報告稱注意力計算量減少約 3 倍,KV 快取縮小 4.4 倍(TestingCatalog)。在上下文長度達到 100 萬 token 時,Z.ai 稱之為 IndexPool 的組件會壓縮索引鍵向量組,以控制延遲和記憶體佔用。這正是讓 100 萬 token 視窗在實際應用中可行的關鍵,而非僅停留於規格表上——長時程代理可以在不導致成本急劇上升的情況下載入更多上下文。
該模型基於 30 兆 token 的多模態語料庫進行訓練,Z.ai 表示其從全新訓練的基礎模型出發,而非沿用 GLM-5.2 的基礎——這與 GLM-5.3 的做法不同,後者重用了 GLM-5.2 的基礎模型,僅在後訓練階段進行擴展。
GLM-5.3-Flash 基準測試
以下所有數據均來自廠商報告或第三方追蹤機構;由於測試框架和設置各有不同,請將其視為方向性參考,而非直接對比。
在編程及代理測試套件上,與 GLM-5.2 相比,提升幅度相當顯著(OfficeChai):
- DeepSWE v1.1: 46.2 → 63.4
- AutomationBench: 26.2 → 48.8(接近翻倍)
- Terminal-Bench 2.1: 84.3——領先 DeepSeek-V4-Vision-Exp,與 Claude Opus 4.8 的 85.0 相差無幾
在同一 Terminal-Bench 測試中,GPT-5.6 Terra(87.4)和 Gemini 3.7 Flash(85.8)仍略勝一籌,但差距已從 GLM-5.2 時期大幅收窄。在 Z.ai 自行於 Claude Code 內部運行的 Code Bench v1.0 測試中,GLM-5.3-Flash 在最大努力模式下達到 29.0,而 Opus 4.8 為 29.5,公司以此為據,說明其 Flash 層級模型在編程能力上已能與前沿模型一較高下。
在獨立機構 Artificial Analysis 的 Intelligence Index 上,GLM-5.3-Flash 得分 57——在同價位推理模型中遠高於中位數。需要坦誠說明的是:Code Bench 等內部基準測試無法獨立複現,且該模型並未宣稱在最難的公開測試套件上超越 GPT-5.6 Sol 或 Fable 5。這是一個性價比選擇,而非排行榜冠軍之爭。
原生多模態:視覺能力融入編程循環
多模態能力並非獨立功能——它內建於模型的工作方式之中。Z.ai 訓練 GLM-5.3-Flash 以檢視渲染後的介面、遊戲畫面及 3D 輸出,然後根據視覺反饋評估並修正自身的工作(TestingCatalog)。
這種「查看結果,再進行修正」的循環對於構建 UI 或儀表板的代理尤為重要:模型可以看到渲染後的頁面,發現問題並進行迭代。同樣的方式也延伸至代碼以外的領域,包括文件、試算表、簡報及會議材料——因此模型能夠跨文字、圖像和結構進行推理,並端到端交付完整的 PPTX、PDF、DOCX 及 XLSX 文件(Z.ai docs)。
GLM-5.3-Flash 的定價是多少?
定價是最大亮點。Z.ai 的標準 API 費率為每 100 萬輸入 token $0.15 美元,每 100 萬輸出 token $0.50 美元,快取輸入為 $0.03 美元(Z.ai on X)。第三方供應商的報價更低——OpenRouter 顯示為輸入 $0.075 / 輸出 $0.25 美元(OpenRouter)。
對於 GLM Coding Plan 訂閱用戶,該模型已上線,並提供 GLM-5.3 三倍的可用配額(TestingCatalog)。這正是與更高價位層級的實際差異:您可以運行長時程代理循環,而無需時刻盯著 token 計量表。
GLM-5.3-Flash 與 GLM-5.3 的比較
兩者為不同用途而設計。GLM-5.3 是注重推理的編程模型——即那個意外習得網絡安全技能、並因安全審查而分階段發布權重的模型。GLM-5.3-Flash 則是高效、多模態、MIT 授權的變體,旨在以低成本大規模運行。
快速對比如下:
- 模態: GLM-5.3 以文字為主;GLM-5.3-Flash 為原生多模態。
- 架構: GLM-5.3 沿用 GLM-5.2 基礎模型;GLM-5.3-Flash 採用全新訓練的基礎模型,結合稀疏注意力與線性注意力的混合架構。
- 效率: GLM-5.3-Flash 的注意力計算量比 GLM-5.3 減少約 3 倍,KV 快取縮小 4.4 倍。
- 授權與權重: GLM-5.3-Flash 首日即以 MIT 授權發布開放權重;GLM-5.3 的權重則分階段發布。
- 成本: GLM-5.3-Flash 定價面向大量使用——據 Z.ai 稱,約為 GLM-5.2 成本的十分之一。
如果您需要對複雜問題進行最深度的推理,GLM-5.3 是首選。如果您正在運行多模態或長時程代理,且每次任務的成本決定了工作流程是否可行,那麼 GLM-5.3-Flash 才是值得測試的選擇。
對 AI 代理開發者的意義
幾點實際啟示:
- 這是全天候代理的成本槓桿。 以每 100 萬輸入 token $0.075–$0.15 美元的定價,配合真實可用的 100 萬 token 視窗,GLM-5.3-Flash 讓長時程代理循環的成本變得可承受,而這是前沿模型難以做到的。
- 多模態改變了代理的驗證能力。 能夠查看渲染介面並進行修正的模型,填補了純文字代理無法完成的閉環——對 UI、儀表板及文件工作尤為實用。
- MIT 授權消除了摩擦。 採用寬鬆授權的開放權重,意味著有數據駐留或供應商審查要求的團隊可以從第一天起自行部署;本地部署支持 SGLang、vLLM 及 TokenSpeed。
- 將內部基準測試視為起點。 Code Bench 數據屬私有且剛剛發布。隨著權重公開,獨立測試才剛剛開始。
在您自己的 AI 工作團隊中運行 GLM-5.3-Flash 等模型
GLM-5.3-Flash 正是為 Eigent 所編排的工作而生:低成本、長時程、多模態的代理循環,端到端運行,而非僅回應單一提示。Eigent 是一款開源本地「Cowork」桌面應用,能將此類模型轉化為多代理工作團隊——從審查 GitHub PR 到運行您完全掌控的自託管 AI 編程代理。自帶模型,工作留在本機。立即下載 Eigent,構建您自己的代理工作流程。
Recent Posts

Cursor Origin:專為 AI 代理打造的 Git 代碼倉庫平台詳解
Cursor Origin 是專為代理時代打造的 git 代碼倉庫平台。了解早期測試版的功能、GitHub 鏡像的運作方式、AI 代理的能力,以及目前仍欠缺的功能。

Slack Code:AI 編程代理進入多人協作模式
Slack Code 將 AI 編程代理置於共享頻道中,讓團隊共同規劃、審查並交付成果。以下介紹代碼頻道的運作方式、適用對象及相關取捨。

GLM-5.3:Z.ai 的編程模型意外習得網絡安全技能
GLM-5.3 詳解:Z.ai 的開放權重模型如何在長周期編程任務上超越 GLM-5.2、意外習得的網絡安全能力,以及模型權重的發布時間表。