GLM-5.3-Flash: O Modelo Multimodal da Z.ai por um Décimo do Preço
O primeiro modelo GLM-5 nativamente multimodal — 320B-A18B, licença MIT, contexto de 1M e preço para rodar agentes o dia todo

A Z.ai lançou o GLM-5.3-Flash em 26 de agosto de 2026 — o primeiro modelo nativamente multimodal da série GLM-5, lançado sob a licença MIT com uma janela de contexto de 1M de tokens (Z.ai no X). É um modelo 320B-A18B que a Z.ai afirma superar o GLM-5.2 em testes de codificação e agentes por aproximadamente um décimo do preço. Veja o que há de realmente novo, os benchmarks que importam para agentes, quanto custa e como ele difere do GLM-5.3.
O que é o GLM-5.3-Flash?
O GLM-5.3-Flash é um modelo Mixture-of-Experts (mistura de especialistas) com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos por token (TestingCatalog). A Z.ai o posiciona como o nível de menor custo e maior eficiência da família GLM-5: desempenho sólido em codificação e tarefas agênticas, mas construído para rodar de forma econômica e responder rapidamente.
Dois aspectos o diferenciam dos lançamentos anteriores do GLM. É o primeiro modelo nativamente multimodal da linha — a visão está integrada ao treinamento, não adicionada posteriormente — e é distribuído sob a licença MIT com pesos abertos no Hugging Face. Se o nome "Ox Alpha" soa familiar, é porque se trata do mesmo modelo: ele rodou anonimamente como ox-alpha no OpenCode e no OpenRouter por cerca de uma semana antes da revelação.
A arquitetura híbrida: atenção mais barata em 1M de tokens
A história de eficiência começa com o design de atenção. O GLM-5.3-Flash é, segundo a Z.ai, o primeiro modelo de fronteira de código aberto a combinar atenção esparsa e atenção linear em uma arquitetura híbrida — atenção linear para dependências locais, atenção esparsa para o contexto global relevante (documentação Z.ai).
O resultado é concreto. Em comparação com o GLM-5.3, a Z.ai reporta aproximadamente 3x menos computação de atenção e um cache KV 4,4x menor (TestingCatalog). Em comprimentos de contexto que chegam a um milhão de tokens, um componente que a Z.ai chama de IndexPool comprime grupos de vetores de chave indexadores para controlar a latência e a memória. É isso que torna uma janela de 1M de tokens utilizável na prática, e não apenas em uma ficha técnica — agentes de longo horizonte podem manter mais contexto carregado sem que o custo exploda.
O modelo foi treinado em um corpus multimodal de 30 trilhões de tokens, e a Z.ai afirma que parte de uma base recém-treinada em vez de reutilizar a do GLM-5.2 — uma diferença em relação à receita do GLM-5.3, que reutilizou a base do GLM-5.2 e escalou apenas o pós-treinamento.
Benchmarks do GLM-5.3-Flash
Todos os números abaixo são reportados pelo fornecedor ou por rastreadores de terceiros; os ambientes e configurações diferem, portanto, leia-os como indicativos e não como comparações diretas.
Em suítes de codificação e agentes versus GLM-5.2, os ganhos são expressivos, não incrementais (OfficeChai):
- DeepSWE v1.1: 46,2 → 63,4
- AutomationBench: 26,2 → 48,8 (quase o dobro)
- Terminal-Bench 2.1: 84,3 — à frente do DeepSeek-V4-Vision-Exp e a um passo do Claude Opus 4.8 com 85,0
No mesmo teste Terminal-Bench, o GPT-5.6 Terra (87,4) e o Gemini 3.7 Flash (85,8) ainda saem na frente, mas a margem diminuiu consideravelmente em relação à posição do GLM-5.2. No Code Bench v1.0 interno da Z.ai — executado dentro do Claude Code — o GLM-5.3-Flash atinge 29,0 no esforço máximo contra 29,5 do Opus 4.8, o que a empresa aponta como evidência de que seu modelo de nível flash agora rivaliza com um modelo de fronteira em codificação.
No Artificial Analysis Intelligence Index independente, o GLM-5.3-Flash pontua 57 — bem acima da mediana para modelos de raciocínio em sua faixa de preço. A ressalva honesta: benchmarks internos como o Code Bench não podem ser replicados de forma independente, e o modelo não reivindica superar o GPT-5.6 Sol ou o Fable 5 nas suítes públicas mais difíceis. É uma aposta em custo-benefício, não em liderança de rankings.
Multimodal nativo: visão integrada ao ciclo de codificação
A capacidade multimodal não é um recurso separado — está integrada ao funcionamento do modelo. A Z.ai treinou o GLM-5.3-Flash para inspecionar interfaces renderizadas, jogos e saídas 3D, e então avaliar e revisar seu próprio trabalho a partir desse feedback visual (TestingCatalog).
Esse ciclo de "ver o resultado e corrigir" é importante para agentes que constroem interfaces ou dashboards: o modelo pode ver a página renderizada, perceber que está errada e iterar. A mesma abordagem se estende além do código para documentos, planilhas, apresentações e materiais de reunião — assim, o modelo pode raciocinar sobre texto, imagens e estrutura, e entregar arquivos PPTX, PDF, DOCX e XLSX completos de ponta a ponta (documentação Z.ai).
Quanto custa o GLM-5.3-Flash?
O preço é o destaque. As tarifas padrão da API da Z.ai são $0,15 por 1M de tokens de entrada e $0,50 por 1M de saída, com entrada em cache a $0,03 (Z.ai no X). Provedores terceiros listam valores ainda menores — o OpenRouter mostra $0,075 de entrada / $0,25 de saída (OpenRouter).
Para assinantes do GLM Coding Plan, já está disponível com 3x a cota utilizável do GLM-5.3 (TestingCatalog). Essa é a diferença prática em relação aos níveis mais caros: você pode executar longos loops de agentes sem ficar de olho em um medidor de tokens.
GLM-5.3-Flash vs GLM-5.3
Eles foram construídos para trabalhos diferentes. O GLM-5.3 é o modelo de codificação com raciocínio intenso — aquele que desenvolveu uma habilidade de cibersegurança não planejada e teve seus pesos liberados em etapas para revisão de segurança. O GLM-5.3-Flash é a variante eficiente, multimodal e com licença MIT, projetada para rodar de forma econômica em escala.
O contraste rápido:
- Modalidade: o GLM-5.3 é focado em texto; o GLM-5.3-Flash é nativamente multimodal.
- Arquitetura: o GLM-5.3 reutiliza a base do GLM-5.2; o GLM-5.3-Flash usa uma base recém-treinada com atenção híbrida esparsa + linear.
- Eficiência: o GLM-5.3-Flash reporta ~3x menos computação de atenção e um cache KV 4,4x menor que o GLM-5.3.
- Licença e pesos: o GLM-5.3-Flash é distribuído com licença MIT e pesos abertos desde o primeiro dia; os pesos do GLM-5.3 foram liberados em etapas.
- Custo: o GLM-5.3-Flash tem preço voltado para volume — aproximadamente um décimo do custo do GLM-5.2, segundo a Z.ai.
Se você precisa do raciocínio mais profundo em um problema difícil, o GLM-5.3 é a escolha. Se você está executando agentes multimodais ou de longo horizonte onde o custo por tarefa decide se o fluxo de trabalho é viável, o GLM-5.3-Flash é o que você deve testar.
O que isso significa para quem constrói agentes de IA
Algumas conclusões práticas:
- Este é um alavancador de custo para agentes que rodam o dia todo. A $0,075–$0,15 por 1M de tokens de entrada com uma janela real de 1M de tokens, o GLM-5.3-Flash torna os loops de agentes de longa duração acessíveis de uma forma que os modelos de fronteira não permitem.
- O multimodal muda o que os agentes podem verificar. Um modelo que consegue ver uma interface renderizada e corrigi-la fecha um ciclo que agentes somente de texto não conseguem — útil para trabalhos com interfaces, dashboards e documentos.
- A licença MIT remove fricção. Pesos abertos sob uma licença permissiva significam que equipes com regras de residência de dados ou revisão de fornecedores podem fazer self-host desde o primeiro dia; a implantação local suporta SGLang, vLLM e TokenSpeed.
- Trate os benchmarks internos como ponto de partida. Os números do Code Bench são privados e recentes. Os testes independentes estão apenas começando agora que os pesos foram disponibilizados.
Execute um modelo como o GLM-5.3-Flash em sua própria força de trabalho de IA
O GLM-5.3-Flash foi construído exatamente para o trabalho que o Eigent orquestra: loops de agentes multimodais, econômicos e de longo horizonte que rodam de ponta a ponta em vez de responder a um único prompt. O Eigent é um aplicativo desktop "Cowork" de código aberto e local que transforma modelos como esses em uma força de trabalho multi-agente — desde revisar PRs no GitHub até executar um agente de codificação de IA com self-host que você controla totalmente. Traga seu próprio modelo, mantenha o trabalho na sua máquina. Baixe o Eigent e construa seus próprios fluxos de trabalho com agentes hoje mesmo.
Recent Posts

Cursor Origin: O Git Forge Criado para Agentes de IA, Explicado
O Cursor Origin é um git forge para a era agêntica. Veja o que foi lançado na beta inicial, como o espelhamento do GitHub funciona, o que os agentes podem fazer e o que ainda está faltando hoje.

Slack Code: Agentes de IA para Programação em Modo Multiplayer
O Slack Code coloca agentes de IA para programação em canais compartilhados para que equipes planejem, revisem e publiquem código juntas. Veja como os canais de código funcionam, para quem são indicados e quais são as vantagens e desvantagens.

GLM-5.3: O Modelo de Codificação da Z.ai Que Desenvolveu uma Habilidade Cibernética Inesperada
GLM-5.3 explicado: como o modelo open-weight da Z.ai supera o GLM-5.2 em codificação de longo horizonte, por que sua capacidade cibernética surpreendeu a equipe e quando os pesos serão disponibilizados.