logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
Aug 26, 2026

GLM-5.3-Flash:Z.ai 的多模態模型,價格僅為十分之一

GLM-5 系列首款原生多模態模型——320B-A18B 架構、MIT 授權、100 萬 Token 上下文,定價讓 AI Agent 全天運行不成問題

EigentEigent
Share to
GLM-5.3-Flash:Z.ai 的多模態模型,價格僅為十分之一
  • 什麼是 GLM-5.3-Flash?
  • 混合架構:在 100 萬 Token 下降低注意力運算成本
  • GLM-5.3-Flash 基準測試成績
  • 原生多模態:視覺能力融入程式碼生成循環
  • GLM-5.3-Flash 的定價是多少?
  • GLM-5.3-Flash 與 GLM-5.3 的比較
  • 對 AI Agent 開發者的意義
  • 在你自己的 AI 工作團隊中運行 GLM-5.3-Flash 這類模型
Automate Everything with
AI Workforce on Desktop
Download Eigent

Z.ai 於 2026 年 8 月 26 日正式發布 GLM-5.3-Flash——這是 GLM-5 系列中首款原生多模態模型,採用 MIT 授權發布,並提供 100 萬 Token 的上下文視窗(Z.ai on X)。這是一款 320B-A18B 模型,Z.ai 表示其在程式碼生成與 AI Agent 測試中全面超越 GLM-5.2,而價格僅約為後者的十分之一。以下將介紹真正的新功能、對 AI Agent 開發者而言重要的基準測試數據、定價資訊,以及它與 GLM-5.3 的差異。

什麼是 GLM-5.3-Flash?

GLM-5.3-Flash 是一款混合專家(Mixture-of-Experts,MoE)模型,總參數量為 3200 億,每個 Token 的活躍參數量為 180 億(TestingCatalog)。Z.ai 將其定位為 GLM-5 系列中成本較低、效率較高的層級:具備強大的程式碼生成與 AI Agent 執行能力,同時以低成本、快速回應為設計目標。

它與早期 GLM 版本有兩大差異。首先,它是該系列首款原生多模態模型——視覺能力內建於訓練過程中,而非事後附加。其次,它以 MIT 授權發布,並在 Hugging Face 上開放模型權重。如果你對「Ox Alpha」這個名字感到熟悉,那是因為這正是同一個模型:它在正式發布前約一週,以 ox-alpha 的匿名身份在 OpenCode 和 OpenRouter 上悄悄運行。

混合架構:在 100 萬 Token 下降低注意力運算成本

效率優勢源自注意力機制的設計。根據 Z.ai 的說法,GLM-5.3-Flash 是首款將**稀疏注意力(sparse attention)與線性注意力(linear attention)**結合於單一混合架構的開源前沿模型——線性注意力處理局部依賴關係,稀疏注意力則負責相關的全局上下文(Z.ai docs)。

這帶來了具體的效益。與 GLM-5.3 相比,Z.ai 報告指出注意力運算量減少約 3 倍,KV 快取(KV cache)縮小 4.4 倍(TestingCatalog)。在上下文長度達到 100 萬 Token 時,Z.ai 稱為 IndexPool 的元件會壓縮索引鍵向量群組,以控制延遲與記憶體用量。這正是讓 100 萬 Token 視窗在實際使用中可行的關鍵,而非僅停留在規格表上——長時程 AI Agent 可以載入更多上下文,而不會導致成本暴增。

該模型在 30 兆 Token 的多模態語料庫上進行訓練,Z.ai 表示其採用全新訓練的基礎模型,而非沿用 GLM-5.2 的基礎——這與 GLM-5.3 的做法不同,後者重用了 GLM-5.2 的基礎模型,僅在後訓練(post-training)階段進行擴展。

GLM-5.3-Flash 基準測試成績

以下所有數據均來自廠商自報或第三方追蹤器;由於測試環境與設定各異,請將其視為方向性參考,而非直接的橫向比較。

在程式碼生成與 AI Agent 測試套件中,相較於 GLM-5.2,提升幅度相當顯著(OfficeChai):

  • DeepSWE v1.1: 46.2 → 63.4
  • AutomationBench: 26.2 → 48.8(近乎翻倍)
  • Terminal-Bench 2.1: 84.3——超越 DeepSeek-V4-Vision-Exp,並接近 Claude Opus 4.8 的 85.0

在同一項 Terminal-Bench 測試中,GPT-5.6 Terra(87.4)和 Gemini 3.7 Flash(85.8)仍略勝一籌,但差距已從 GLM-5.2 時期大幅縮小。在 Z.ai 自行於 Claude Code 內部執行的 Code Bench v1.0 測試中,GLM-5.3-Flash 在最大努力模式下達到 29.0,接近 Opus 4.8 的 29.5,公司以此作為其 Flash 層級模型現已能在程式碼生成上與前沿模型一較高下的佐證。

在獨立機構 Artificial Analysis 的 Intelligence Index 中,GLM-5.3-Flash 獲得 57 分——在同價位推理模型中遠高於中位數。需要誠實說明的是:像 Code Bench 這樣的內部基準測試無法被獨立重現,且該模型並未宣稱在最難的公開測試套件上超越 GPT-5.6 Sol 或 Fable 5。這是一款性價比導向的模型,而非以排行榜第一為目標。

原生多模態:視覺能力融入程式碼生成循環

多模態能力並非獨立功能,而是深度整合於模型的運作方式中。Z.ai 訓練 GLM-5.3-Flash 能夠檢視渲染後的介面、遊戲畫面與 3D 輸出,並根據視覺回饋評估並修正自身的工作成果(TestingCatalog)。

這種「查看結果,再進行修正」的循環對於建構 UI 或儀表板的 AI Agent 至關重要:模型可以看到渲染後的頁面,發現問題所在,並進行迭代修正。同樣的方法也延伸至程式碼以外的領域,包括文件、試算表、簡報與會議資料——因此模型能夠跨文字、圖像與結構進行推理,並端對端交付完整的 PPTX、PDF、DOCX 與 XLSX 檔案(Z.ai docs)。

GLM-5.3-Flash 的定價是多少?

定價是最大亮點。Z.ai 的標準 API 費率為每 100 萬輸入 Token 收費 $0.15 美元,每 100 萬輸出 Token 收費 $0.50 美元,快取輸入則為 $0.03 美元(Z.ai on X)。第三方供應商的報價更低——OpenRouter 顯示為輸入 $0.075 / 輸出 $0.25 美元(OpenRouter)。

對於 GLM Coding Plan 訂閱者,該模型已上線,並提供 GLM-5.3 三倍的可用配額(TestingCatalog)。這正是它與較高價位方案的實際差異:你可以執行長時程的 AI Agent 循環,而無需時刻盯著 Token 用量計量表。

GLM-5.3-Flash 與 GLM-5.3 的比較

兩者為不同用途而設計。GLM-5.3 是以深度推理為核心的程式碼生成模型——也就是那款意外習得網路安全技能、並因安全審查而分階段發布模型權重的版本。GLM-5.3-Flash 則是高效率、多模態、MIT 授權的變體,旨在以低成本大規模運行。

快速對比如下:

  • 模態支援: GLM-5.3 以文字為主;GLM-5.3-Flash 為原生多模態。
  • 架構: GLM-5.3 沿用 GLM-5.2 的基礎模型;GLM-5.3-Flash 採用全新訓練的基礎模型,並結合稀疏注意力與線性注意力的混合架構。
  • 效率: GLM-5.3-Flash 相較於 GLM-5.3,注意力運算量減少約 3 倍,KV 快取縮小 4.4 倍。
  • 授權與模型權重: GLM-5.3-Flash 於發布首日即以 MIT 授權開放模型權重;GLM-5.3 的權重則採分階段發布。
  • 成本: GLM-5.3-Flash 以大量使用為定價導向——根據 Z.ai 的說法,成本約為 GLM-5.2 的十分之一。

如果你需要針對複雜問題進行最深度的推理,GLM-5.3 是首選。如果你正在運行多模態或長時程 AI Agent,且每項任務的成本決定了工作流程是否可行,那麼 GLM-5.3-Flash 才是值得測試的選擇。

對 AI Agent 開發者的意義

幾點實際的結論:

  • 這是全天候 AI Agent 的成本控制利器。 在每 100 萬輸入 Token 僅需 $0.075–$0.15 美元、且具備真實 100 萬 Token 視窗的條件下,GLM-5.3-Flash 讓長時程 AI Agent 循環的運行成本變得可負擔,而這是前沿模型難以做到的。
  • 多模態能力改變了 AI Agent 的驗證方式。 能夠看到渲染後介面並進行修正的模型,彌補了純文字 AI Agent 無法完成的閉環——對 UI、儀表板與文件工作尤為實用。
  • MIT 授權消除了部署阻力。 採用寬鬆授權的開放模型權重,意味著有資料存放地點或供應商審查要求的團隊可以從第一天起就自行部署;本地部署支援 SGLang、vLLM 與 TokenSpeed。
  • 將內部基準測試視為起點。 Code Bench 的數據是私有且全新的,獨立測試才剛開始,因為模型權重剛剛公開。

在你自己的 AI 工作團隊中運行 GLM-5.3-Flash 這類模型

GLM-5.3-Flash 正是為 Eigent 所編排的工作場景而生:低成本、長時程、多模態的 AI Agent 循環,能夠端對端完整執行,而非僅回應單一提示。Eigent 是一款開源的本地「Cowork」桌面應用程式,能將這類模型轉化為多 AI Agent 工作團隊——從審查 GitHub PR 到運行你完全掌控的自架 AI 程式碼生成 Agent。自帶模型,工作留在你的機器上。立即下載 Eigent,打造屬於你自己的 AI Agent 工作流程。

Recent Posts

可攜式 Agent 記憶體:在 Claude Code、Cursor、Codex 與 Gemini 之間保留上下文
Oct 6, 2026

可攜式 Agent 記憶體:在 Claude Code、Cursor、Codex 與 Gemini 之間保留上下文

了解可攜式 Agent 記憶體如何在 Claude Code、Cursor、Codex 與 Gemini 之間傳遞上下文、其背後的實作方式,以及如何避免供應商鎖定。

EigentEigent
Gemini 4 Argon:新功能、基準測試與定價
Oct 2, 2026

Gemini 4 Argon:新功能、基準測試與定價

Gemini 4 Argon 是 Google 專為長時程工作打造的前沿模型。了解新功能、基準測試、定價、100 萬輸出 token 上限,以及誰能優先取得存取權。

EigentEigent
Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
產品Sep 25, 2026

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews

Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

感謝您的訂閱!

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募說明中心使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD