logo
  • Ambientes
  • Empresas
  • Preços
Blogs
Aug 26, 2026

GLM-5.3-Flash: O Modelo Multimodal da Z.ai por um Décimo do Preço

O primeiro modelo GLM-5 nativamente multimodal — 320B-A18B, licença MIT, contexto de 1M e preço para rodar agentes o dia todo

EigentEigent
Share to
GLM-5.3-Flash: O Modelo Multimodal da Z.ai por um Décimo do Preço
  • O que é o GLM-5.3-Flash?
  • A arquitetura híbrida: atenção mais barata em 1M de tokens
  • Benchmarks do GLM-5.3-Flash
  • Multimodal nativo: visão integrada ao ciclo de codificação
  • Quanto custa o GLM-5.3-Flash?
  • GLM-5.3-Flash vs GLM-5.3
  • O que isso significa para quem constrói agentes de IA
  • Execute um modelo como o GLM-5.3-Flash em sua própria força de trabalho de IA
Automate Everything with
AI Workforce on Desktop
Download Eigent

A Z.ai lançou o GLM-5.3-Flash em 26 de agosto de 2026 — o primeiro modelo nativamente multimodal da série GLM-5, lançado sob a licença MIT com uma janela de contexto de 1M de tokens (Z.ai no X). É um modelo 320B-A18B que a Z.ai afirma superar o GLM-5.2 em testes de codificação e agentes por aproximadamente um décimo do preço. Veja o que há de realmente novo, os benchmarks que importam para agentes, quanto custa e como ele difere do GLM-5.3.

O que é o GLM-5.3-Flash?

O GLM-5.3-Flash é um modelo Mixture-of-Experts (mistura de especialistas) com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos por token (TestingCatalog). A Z.ai o posiciona como o nível de menor custo e maior eficiência da família GLM-5: desempenho sólido em codificação e tarefas agênticas, mas construído para rodar de forma econômica e responder rapidamente.

Dois aspectos o diferenciam dos lançamentos anteriores do GLM. É o primeiro modelo nativamente multimodal da linha — a visão está integrada ao treinamento, não adicionada posteriormente — e é distribuído sob a licença MIT com pesos abertos no Hugging Face. Se o nome "Ox Alpha" soa familiar, é porque se trata do mesmo modelo: ele rodou anonimamente como ox-alpha no OpenCode e no OpenRouter por cerca de uma semana antes da revelação.

A arquitetura híbrida: atenção mais barata em 1M de tokens

A história de eficiência começa com o design de atenção. O GLM-5.3-Flash é, segundo a Z.ai, o primeiro modelo de fronteira de código aberto a combinar atenção esparsa e atenção linear em uma arquitetura híbrida — atenção linear para dependências locais, atenção esparsa para o contexto global relevante (documentação Z.ai).

O resultado é concreto. Em comparação com o GLM-5.3, a Z.ai reporta aproximadamente 3x menos computação de atenção e um cache KV 4,4x menor (TestingCatalog). Em comprimentos de contexto que chegam a um milhão de tokens, um componente que a Z.ai chama de IndexPool comprime grupos de vetores de chave indexadores para controlar a latência e a memória. É isso que torna uma janela de 1M de tokens utilizável na prática, e não apenas em uma ficha técnica — agentes de longo horizonte podem manter mais contexto carregado sem que o custo exploda.

O modelo foi treinado em um corpus multimodal de 30 trilhões de tokens, e a Z.ai afirma que parte de uma base recém-treinada em vez de reutilizar a do GLM-5.2 — uma diferença em relação à receita do GLM-5.3, que reutilizou a base do GLM-5.2 e escalou apenas o pós-treinamento.

Benchmarks do GLM-5.3-Flash

Todos os números abaixo são reportados pelo fornecedor ou por rastreadores de terceiros; os ambientes e configurações diferem, portanto, leia-os como indicativos e não como comparações diretas.

Em suítes de codificação e agentes versus GLM-5.2, os ganhos são expressivos, não incrementais (OfficeChai):

  • DeepSWE v1.1: 46,2 → 63,4
  • AutomationBench: 26,2 → 48,8 (quase o dobro)
  • Terminal-Bench 2.1: 84,3 — à frente do DeepSeek-V4-Vision-Exp e a um passo do Claude Opus 4.8 com 85,0

No mesmo teste Terminal-Bench, o GPT-5.6 Terra (87,4) e o Gemini 3.7 Flash (85,8) ainda saem na frente, mas a margem diminuiu consideravelmente em relação à posição do GLM-5.2. No Code Bench v1.0 interno da Z.ai — executado dentro do Claude Code — o GLM-5.3-Flash atinge 29,0 no esforço máximo contra 29,5 do Opus 4.8, o que a empresa aponta como evidência de que seu modelo de nível flash agora rivaliza com um modelo de fronteira em codificação.

No Artificial Analysis Intelligence Index independente, o GLM-5.3-Flash pontua 57 — bem acima da mediana para modelos de raciocínio em sua faixa de preço. A ressalva honesta: benchmarks internos como o Code Bench não podem ser replicados de forma independente, e o modelo não reivindica superar o GPT-5.6 Sol ou o Fable 5 nas suítes públicas mais difíceis. É uma aposta em custo-benefício, não em liderança de rankings.

Multimodal nativo: visão integrada ao ciclo de codificação

A capacidade multimodal não é um recurso separado — está integrada ao funcionamento do modelo. A Z.ai treinou o GLM-5.3-Flash para inspecionar interfaces renderizadas, jogos e saídas 3D, e então avaliar e revisar seu próprio trabalho a partir desse feedback visual (TestingCatalog).

Esse ciclo de "ver o resultado e corrigir" é importante para agentes que constroem interfaces ou dashboards: o modelo pode ver a página renderizada, perceber que está errada e iterar. A mesma abordagem se estende além do código para documentos, planilhas, apresentações e materiais de reunião — assim, o modelo pode raciocinar sobre texto, imagens e estrutura, e entregar arquivos PPTX, PDF, DOCX e XLSX completos de ponta a ponta (documentação Z.ai).

Quanto custa o GLM-5.3-Flash?

O preço é o destaque. As tarifas padrão da API da Z.ai são $0,15 por 1M de tokens de entrada e $0,50 por 1M de saída, com entrada em cache a $0,03 (Z.ai no X). Provedores terceiros listam valores ainda menores — o OpenRouter mostra $0,075 de entrada / $0,25 de saída (OpenRouter).

Para assinantes do GLM Coding Plan, já está disponível com 3x a cota utilizável do GLM-5.3 (TestingCatalog). Essa é a diferença prática em relação aos níveis mais caros: você pode executar longos loops de agentes sem ficar de olho em um medidor de tokens.

GLM-5.3-Flash vs GLM-5.3

Eles foram construídos para trabalhos diferentes. O GLM-5.3 é o modelo de codificação com raciocínio intenso — aquele que desenvolveu uma habilidade de cibersegurança não planejada e teve seus pesos liberados em etapas para revisão de segurança. O GLM-5.3-Flash é a variante eficiente, multimodal e com licença MIT, projetada para rodar de forma econômica em escala.

O contraste rápido:

  • Modalidade: o GLM-5.3 é focado em texto; o GLM-5.3-Flash é nativamente multimodal.
  • Arquitetura: o GLM-5.3 reutiliza a base do GLM-5.2; o GLM-5.3-Flash usa uma base recém-treinada com atenção híbrida esparsa + linear.
  • Eficiência: o GLM-5.3-Flash reporta ~3x menos computação de atenção e um cache KV 4,4x menor que o GLM-5.3.
  • Licença e pesos: o GLM-5.3-Flash é distribuído com licença MIT e pesos abertos desde o primeiro dia; os pesos do GLM-5.3 foram liberados em etapas.
  • Custo: o GLM-5.3-Flash tem preço voltado para volume — aproximadamente um décimo do custo do GLM-5.2, segundo a Z.ai.

Se você precisa do raciocínio mais profundo em um problema difícil, o GLM-5.3 é a escolha. Se você está executando agentes multimodais ou de longo horizonte onde o custo por tarefa decide se o fluxo de trabalho é viável, o GLM-5.3-Flash é o que você deve testar.

O que isso significa para quem constrói agentes de IA

Algumas conclusões práticas:

  • Este é um alavancador de custo para agentes que rodam o dia todo. A $0,075–$0,15 por 1M de tokens de entrada com uma janela real de 1M de tokens, o GLM-5.3-Flash torna os loops de agentes de longa duração acessíveis de uma forma que os modelos de fronteira não permitem.
  • O multimodal muda o que os agentes podem verificar. Um modelo que consegue ver uma interface renderizada e corrigi-la fecha um ciclo que agentes somente de texto não conseguem — útil para trabalhos com interfaces, dashboards e documentos.
  • A licença MIT remove fricção. Pesos abertos sob uma licença permissiva significam que equipes com regras de residência de dados ou revisão de fornecedores podem fazer self-host desde o primeiro dia; a implantação local suporta SGLang, vLLM e TokenSpeed.
  • Trate os benchmarks internos como ponto de partida. Os números do Code Bench são privados e recentes. Os testes independentes estão apenas começando agora que os pesos foram disponibilizados.

Execute um modelo como o GLM-5.3-Flash em sua própria força de trabalho de IA

O GLM-5.3-Flash foi construído exatamente para o trabalho que o Eigent orquestra: loops de agentes multimodais, econômicos e de longo horizonte que rodam de ponta a ponta em vez de responder a um único prompt. O Eigent é um aplicativo desktop "Cowork" de código aberto e local que transforma modelos como esses em uma força de trabalho multi-agente — desde revisar PRs no GitHub até executar um agente de codificação de IA com self-host que você controla totalmente. Traga seu próprio modelo, mantenha o trabalho na sua máquina. Baixe o Eigent e construa seus próprios fluxos de trabalho com agentes hoje mesmo.

Recent Posts

Memória Portátil de Agentes: Carregue Contexto pelo Claude Code, Cursor, Codex e Gemini
Oct 6, 2026

Memória Portátil de Agentes: Carregue Contexto pelo Claude Code, Cursor, Codex e Gemini

Aprenda como a memória portátil de agentes carrega contexto pelo Claude Code, Cursor, Codex e Gemini, as abordagens que a impulsionam e como evitar dependência de fornecedor.

EigentEigent
Gemini 4 Argon: O Que Há de Novo, Benchmarks e Preços
Oct 2, 2026

Gemini 4 Argon: O Que Há de Novo, Benchmarks e Preços

Gemini 4 Argon é o modelo de fronteira do Google para trabalhos de longo horizonte. Veja o que há de novo, os benchmarks, preços, o limite de 1M tokens de saída e quem obtém acesso primeiro.

EigentEigent
Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
ProdutoSep 25, 2026

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews

Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Experimente o Eigent hoje

Baixe o app desktop open source e comece a automatizar com uma força de trabalho de IA na sua máquina.

Baixar Eigent
Eigent

Receba as últimas novidades e tutoriais sobre automação de workforce com IA.

Obrigado por se inscrever!

ProdutoEigentAmbientesPreçosEmpresarial
ExplorarSoluçõesCasos de usoHabilidadesPluginsBlog
DesenvolvedoresDocumentaçãoGitHubCAMEL-AIFundo Open SourceParceiro
BaixarPara código aberto
EmpresaSobre nósMarcaCarreirasSuporteTermos de usoPolítica de privacidadeSegurança e confiançaPolítica de cookiesPolítica de reembolso e teste

Todos os direitos reservados © 2026 EIGENT UK LTD