logo
  • Ambientes
  • Empresas
  • Preços
Blogs
Aug 26, 2026

GLM-5.3-Flash: O Modelo Multimodal da Z.ai por um Décimo do Preço

O primeiro modelo GLM-5 nativamente multimodal — 320B-A18B, licença MIT, contexto de 1M e preço para rodar agentes o dia todo

EigentEigent
Share to
GLM-5.3-Flash: O Modelo Multimodal da Z.ai por um Décimo do Preço
  • O que é o GLM-5.3-Flash?
  • A arquitetura híbrida: atenção mais barata em 1M de tokens
  • Benchmarks do GLM-5.3-Flash
  • Multimodal nativo: visão integrada ao ciclo de codificação
  • Quanto custa o GLM-5.3-Flash?
  • GLM-5.3-Flash vs GLM-5.3
  • O que isso significa para quem constrói agentes de IA
  • Execute um modelo como o GLM-5.3-Flash em sua própria força de trabalho de IA
Automate Everything with
AI Workforce on Desktop
Download Eigent

A Z.ai lançou o GLM-5.3-Flash em 26 de agosto de 2026 — o primeiro modelo nativamente multimodal da série GLM-5, lançado sob a licença MIT com uma janela de contexto de 1M de tokens (Z.ai no X). É um modelo 320B-A18B que a Z.ai afirma superar o GLM-5.2 em testes de codificação e agentes por aproximadamente um décimo do preço. Veja o que há de realmente novo, os benchmarks que importam para agentes, quanto custa e como ele difere do GLM-5.3.

O que é o GLM-5.3-Flash?

O GLM-5.3-Flash é um modelo Mixture-of-Experts (mistura de especialistas) com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos por token (TestingCatalog). A Z.ai o posiciona como o nível de menor custo e maior eficiência da família GLM-5: desempenho sólido em codificação e tarefas agênticas, mas construído para rodar de forma econômica e responder rapidamente.

Dois aspectos o diferenciam dos lançamentos anteriores do GLM. É o primeiro modelo nativamente multimodal da linha — a visão está integrada ao treinamento, não adicionada posteriormente — e é distribuído sob a licença MIT com pesos abertos no Hugging Face. Se o nome "Ox Alpha" soa familiar, é porque se trata do mesmo modelo: ele rodou anonimamente como ox-alpha no OpenCode e no OpenRouter por cerca de uma semana antes da revelação.

A arquitetura híbrida: atenção mais barata em 1M de tokens

A história de eficiência começa com o design de atenção. O GLM-5.3-Flash é, segundo a Z.ai, o primeiro modelo de fronteira de código aberto a combinar atenção esparsa e atenção linear em uma arquitetura híbrida — atenção linear para dependências locais, atenção esparsa para o contexto global relevante (documentação Z.ai).

O resultado é concreto. Em comparação com o GLM-5.3, a Z.ai reporta aproximadamente 3x menos computação de atenção e um cache KV 4,4x menor (TestingCatalog). Em comprimentos de contexto que chegam a um milhão de tokens, um componente que a Z.ai chama de IndexPool comprime grupos de vetores de chave indexadores para controlar a latência e a memória. É isso que torna uma janela de 1M de tokens utilizável na prática, e não apenas em uma ficha técnica — agentes de longo horizonte podem manter mais contexto carregado sem que o custo exploda.

O modelo foi treinado em um corpus multimodal de 30 trilhões de tokens, e a Z.ai afirma que parte de uma base recém-treinada em vez de reutilizar a do GLM-5.2 — uma diferença em relação à receita do GLM-5.3, que reutilizou a base do GLM-5.2 e escalou apenas o pós-treinamento.

Benchmarks do GLM-5.3-Flash

Todos os números abaixo são reportados pelo fornecedor ou por rastreadores de terceiros; os ambientes e configurações diferem, portanto, leia-os como indicativos e não como comparações diretas.

Em suítes de codificação e agentes versus GLM-5.2, os ganhos são expressivos, não incrementais (OfficeChai):

  • DeepSWE v1.1: 46,2 → 63,4
  • AutomationBench: 26,2 → 48,8 (quase o dobro)
  • Terminal-Bench 2.1: 84,3 — à frente do DeepSeek-V4-Vision-Exp e a um passo do Claude Opus 4.8 com 85,0

No mesmo teste Terminal-Bench, o GPT-5.6 Terra (87,4) e o Gemini 3.7 Flash (85,8) ainda saem na frente, mas a margem diminuiu consideravelmente em relação à posição do GLM-5.2. No Code Bench v1.0 interno da Z.ai — executado dentro do Claude Code — o GLM-5.3-Flash atinge 29,0 no esforço máximo contra 29,5 do Opus 4.8, o que a empresa aponta como evidência de que seu modelo de nível flash agora rivaliza com um modelo de fronteira em codificação.

No Artificial Analysis Intelligence Index independente, o GLM-5.3-Flash pontua 57 — bem acima da mediana para modelos de raciocínio em sua faixa de preço. A ressalva honesta: benchmarks internos como o Code Bench não podem ser replicados de forma independente, e o modelo não reivindica superar o GPT-5.6 Sol ou o Fable 5 nas suítes públicas mais difíceis. É uma aposta em custo-benefício, não em liderança de rankings.

Multimodal nativo: visão integrada ao ciclo de codificação

A capacidade multimodal não é um recurso separado — está integrada ao funcionamento do modelo. A Z.ai treinou o GLM-5.3-Flash para inspecionar interfaces renderizadas, jogos e saídas 3D, e então avaliar e revisar seu próprio trabalho a partir desse feedback visual (TestingCatalog).

Esse ciclo de "ver o resultado e corrigir" é importante para agentes que constroem interfaces ou dashboards: o modelo pode ver a página renderizada, perceber que está errada e iterar. A mesma abordagem se estende além do código para documentos, planilhas, apresentações e materiais de reunião — assim, o modelo pode raciocinar sobre texto, imagens e estrutura, e entregar arquivos PPTX, PDF, DOCX e XLSX completos de ponta a ponta (documentação Z.ai).

Quanto custa o GLM-5.3-Flash?

O preço é o destaque. As tarifas padrão da API da Z.ai são $0,15 por 1M de tokens de entrada e $0,50 por 1M de saída, com entrada em cache a $0,03 (Z.ai no X). Provedores terceiros listam valores ainda menores — o OpenRouter mostra $0,075 de entrada / $0,25 de saída (OpenRouter).

Para assinantes do GLM Coding Plan, já está disponível com 3x a cota utilizável do GLM-5.3 (TestingCatalog). Essa é a diferença prática em relação aos níveis mais caros: você pode executar longos loops de agentes sem ficar de olho em um medidor de tokens.

GLM-5.3-Flash vs GLM-5.3

Eles foram construídos para trabalhos diferentes. O GLM-5.3 é o modelo de codificação com raciocínio intenso — aquele que desenvolveu uma habilidade de cibersegurança não planejada e teve seus pesos liberados em etapas para revisão de segurança. O GLM-5.3-Flash é a variante eficiente, multimodal e com licença MIT, projetada para rodar de forma econômica em escala.

O contraste rápido:

  • Modalidade: o GLM-5.3 é focado em texto; o GLM-5.3-Flash é nativamente multimodal.
  • Arquitetura: o GLM-5.3 reutiliza a base do GLM-5.2; o GLM-5.3-Flash usa uma base recém-treinada com atenção híbrida esparsa + linear.
  • Eficiência: o GLM-5.3-Flash reporta ~3x menos computação de atenção e um cache KV 4,4x menor que o GLM-5.3.
  • Licença e pesos: o GLM-5.3-Flash é distribuído com licença MIT e pesos abertos desde o primeiro dia; os pesos do GLM-5.3 foram liberados em etapas.
  • Custo: o GLM-5.3-Flash tem preço voltado para volume — aproximadamente um décimo do custo do GLM-5.2, segundo a Z.ai.

Se você precisa do raciocínio mais profundo em um problema difícil, o GLM-5.3 é a escolha. Se você está executando agentes multimodais ou de longo horizonte onde o custo por tarefa decide se o fluxo de trabalho é viável, o GLM-5.3-Flash é o que você deve testar.

O que isso significa para quem constrói agentes de IA

Algumas conclusões práticas:

  • Este é um alavancador de custo para agentes que rodam o dia todo. A $0,075–$0,15 por 1M de tokens de entrada com uma janela real de 1M de tokens, o GLM-5.3-Flash torna os loops de agentes de longa duração acessíveis de uma forma que os modelos de fronteira não permitem.
  • O multimodal muda o que os agentes podem verificar. Um modelo que consegue ver uma interface renderizada e corrigi-la fecha um ciclo que agentes somente de texto não conseguem — útil para trabalhos com interfaces, dashboards e documentos.
  • A licença MIT remove fricção. Pesos abertos sob uma licença permissiva significam que equipes com regras de residência de dados ou revisão de fornecedores podem fazer self-host desde o primeiro dia; a implantação local suporta SGLang, vLLM e TokenSpeed.
  • Trate os benchmarks internos como ponto de partida. Os números do Code Bench são privados e recentes. Os testes independentes estão apenas começando agora que os pesos foram disponibilizados.

Execute um modelo como o GLM-5.3-Flash em sua própria força de trabalho de IA

O GLM-5.3-Flash foi construído exatamente para o trabalho que o Eigent orquestra: loops de agentes multimodais, econômicos e de longo horizonte que rodam de ponta a ponta em vez de responder a um único prompt. O Eigent é um aplicativo desktop "Cowork" de código aberto e local que transforma modelos como esses em uma força de trabalho multi-agente — desde revisar PRs no GitHub até executar um agente de codificação de IA com self-host que você controla totalmente. Traga seu próprio modelo, mantenha o trabalho na sua máquina. Baixe o Eigent e construa seus próprios fluxos de trabalho com agentes hoje mesmo.

Recent Posts

Cursor Origin: O Git Forge Criado para Agentes de IA, Explicado
Aug 24, 2026

Cursor Origin: O Git Forge Criado para Agentes de IA, Explicado

O Cursor Origin é um git forge para a era agêntica. Veja o que foi lançado na beta inicial, como o espelhamento do GitHub funciona, o que os agentes podem fazer e o que ainda está faltando hoje.

EigentEigent
Slack Code: Agentes de IA para Programação em Modo Multiplayer
SetorAug 21, 2026

Slack Code: Agentes de IA para Programação em Modo Multiplayer

O Slack Code coloca agentes de IA para programação em canais compartilhados para que equipes planejem, revisem e publiquem código juntas. Veja como os canais de código funcionam, para quem são indicados e quais são as vantagens e desvantagens.

EigentEigent
GLM-5.3: O Modelo de Codificação da Z.ai Que Desenvolveu uma Habilidade Cibernética Inesperada
Aug 14, 2026

GLM-5.3: O Modelo de Codificação da Z.ai Que Desenvolveu uma Habilidade Cibernética Inesperada

GLM-5.3 explicado: como o modelo open-weight da Z.ai supera o GLM-5.2 em codificação de longo horizonte, por que sua capacidade cibernética surpreendeu a equipe e quando os pesos serão disponibilizados.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Experimente o Eigent hoje

Baixe o app desktop open source e comece a automatizar com uma força de trabalho de IA na sua máquina.

Baixar Eigent
Eigent

Receba as últimas novidades e tutoriais sobre automação de workforce com IA.

ProdutoEigentAmbientesPreçosEmpresarial
ExplorarSoluçõesCasos de usoHabilidadesPluginsBlog
DesenvolvedoresDocumentaçãoGitHubCAMEL-AIFundo Open SourceParceiro
BaixarPara código aberto
EmpresaSobre nósMarcaCarreirasTermos de usoPolítica de privacidadeSegurança e confiançaPolítica de cookiesPolítica de reembolso e teste

Todos os direitos reservados © 2026 EIGENT UK LTD

Nova versão do Eigent 1.0 lançada!download