GLM-5.2: O modelo de codificação e agentic com 1M tokens e pesos abertos da Zhipu AI
O carro-chefe da Zhipu com licença MIT foi criado para codificação, uso de ferramentas e agentes de longo prazo — veja o que isso significa para builders

A Zhipu AI acabou de lançar um modelo de pesos abertos que parece ter sido projetado para agentes, e não para chat. GLM-5.2 é o mais recente carro-chefe da Zhipu — construído especificamente para codificação, raciocínio e workloads "agentic" orientados por ferramentas — e chega com uma janela de contexto de 1 milhão de tokens sob uma licença open source MIT. Lançado em 13 de junho de 2026, ele sucede o GLM-5.1 na família GLM-5 e já está disponível no GLM Coding Plan da Z.ai e em múltiplas plataformas de terceiros. (apidog)
Se você está construindo agentes de IA, ferramentas autônomas de codificação ou workflows de longo prazo, o GLM-5.2 é um dos primeiros modelos de pesos abertos que parecem ter sido feitos para o seu caso de uso — e não adaptados de um assistente genérico. Este guia explica o que o GLM-5.2 realmente é, sua arquitetura e janela de contexto, modos de raciocínio, preços, o panorama inicial de benchmarks e os padrões que builders estão usando para extrair o máximo dele em plataformas de agentes como a Eigent.
O que é o GLM-5.2?
GLM-5.2 é um large language model de pesos abertos da Zhipu AI (operando globalmente como Z.ai), fortemente ajustado para engenharia de software, raciocínio em múltiplas etapas e trabalho agentic com suporte de ferramentas. Ele se baseia na fundação Mixture-of-Experts (MoE) introduzida com o GLM-5 e o GLM-5.1, mas expande a janela de contexto para um aproveitável 1 milhão de tokens, mantendo um forte desempenho em codificação. (Modular)
Por baixo dos panos, o GLM-5.2 usa cerca de 750B de parâmetros em um design MoE esparso, com aproximadamente 40B de parâmetros ativos por token, combinado com uma nova técnica de atenção esparsa chamada "IndexShare", projetada para manter sob controle os custos de inferência com 1M de contexto. A Zhipu posiciona o modelo como um sistema orientado para codificação, e não como um modelo de chat de uso geral — a conversa é tratada como um efeito colateral de construir um mecanismo robusto voltado para desenvolvedores. (LLM Reference)
Esse enquadramento agent-first coloca o GLM-5.2 na mesma conversa que o Claude Fable 5 da Anthropic: modelos de fronteira cada vez mais projetados primeiro em torno de uso agentic de longo prazo, com chat como interface secundária.
Especificações e arquitetura principais
Os recursos principais do GLM-5.2 giram em torno de contexto, raciocínio e abertura. (DataCamp)
- Janela de contexto de 1M tokens via o ID de modelo
glm-5.2[1m]— espaço suficiente para monorepos completos, documentos grandes ou estado de agentes em execução contínua. (note) - Até 131.072 tokens de saída por resposta — suficiente para gerar ou refatorar arquivos muito grandes em uma única passada. (Lush Binary)
- Design MoE com aproximadamente 753B de parâmetros totais e cerca de 40B ativos por token, reutilizando a base do GLM-5.1. (dev.to)
- IndexShare — um esquema de atenção esparsa que reutiliza o mesmo indexador de atenção em múltiplas camadas esparsas, reduzindo os FLOPs por token em comprimentos de contexto longos. (Latent Space)
- Camadas aprimoradas de previsão de múltiplos tokens (MTP) para speculative decoding, supostamente aumentando as taxas de aceitação em até ~20% e ajudando na vazão. (Latent Space)
A Z.ai destacou que o GLM-5.2 mantém o "DNA de pesos abertos e foco em codificação" da série GLM-5, ao mesmo tempo em que atualiza a janela de contexto e os controles de raciocínio em vez de buscar uma arquitetura totalmente nova. (Modular)
Contexto de 1M Tokens: por que isso importa
A janela de contexto de 1 milhão de tokens é o diferencial mais óbvio do GLM-5.2. Isso é cerca de cinco vezes maior que a janela anterior do GLM-5.x e coloca o GLM-5.2 entre as maiores janelas de contexto publicamente utilizáveis no ecossistema de pesos abertos. (LLM Reference)
Na prática, isso desbloqueia vários workflows que historicamente eram frágeis:
- Entendimento de código em escala de repositório — carregar serviços inteiros, monorepos ou clusters de microserviços em um único contexto sem truncamento agressivo. (Lush Binary)
- Agentes de longa duração — os agentes podem manter memória de trabalho de vários dias ou várias sessões em contexto, em vez de comprimir tudo em resumos específicos de ferramentas. (CometAPI)
- Análise complexa de documentos — acervos jurídicos, padrões técnicos ou PDFs com milhares de páginas tornam-se tratáveis em uma única passada, em vez de pipelines de chunk-and-stitch. (CometAPI)
A integração do Cloudflare Workers AI é um sinal útil aqui: ela expõe o GLM-5.2 com function calling, suporte a reasoning e um grande contexto (implantação atual em 262k tokens, com planos de expansão), mirando especificamente codebases grandes e planejamento em múltiplas etapas. Isso aponta para um modelo ajustado para workloads sustentadas e de alto contexto — não apenas para um número de marketing de "1M". (Cloudflare)
Dois modos de raciocínio: High vs Max
O GLM-5.2 introduz um sistema de "thinking-effort" em dois níveis: High e Max. (AI Weekly)
- High é o modo padrão para a maioria das tarefas de codificação, usando raciocínio estruturado em chain-of-thought antes de responder, mas com um orçamento de raciocínio limitado. A Z.ai recomenda esse modo para geração de código do dia a dia, refatoração e debugging em que você quer confiabilidade e velocidade. (DataCamp)
- Max aumenta o orçamento de raciocínio para problemas mais complexos e sequências agentic mais longas, ao custo de latência e tokens. Ele é voltado para bugs não triviais, refatorações entre serviços, mudanças de arquitetura e planejamento em múltiplas etapas. (AI Weekly)
Do ponto de vista de design de agentes, isso oferece uma alavanca para combinar a profundidade do raciocínio com a dificuldade da tarefa sem trocar de modelo. Você pode encaminhar operações rotineiras pelo High e escalar tickets difíceis, etapas de planejamento ou tentativas fracassadas para o Max — uma versão com um único modelo do padrão de classificação e roteamento do qual sistemas agentic sérios já dependem.
Capacidades agentic e uso de ferramentas
A Zhipu descreve o GLM-5.2 como um modelo "agent-oriented", projetado para dar suporte a workflows autônomos, agentes com suporte de ferramentas e tarefas de codificação de longo prazo. (Atlas Cloud)
A implantação da Cloudflare descreve @cf/zai-org/glm-5.2 como um modelo de geração de texto "built for agentic coding workflows", com suporte de primeira classe para function calling e uso de ferramentas em múltiplas interações. Ela destaca especificamente: (Cloudflare)
- Function calling para invocar ferramentas e APIs ao longo de várias interações de conversa, permitindo loops clássicos de uso de ferramentas por agentes.
- Planejamento de longo prazo em codebases grandes, impulsionado pelo contexto de 1M e pelos modos de raciocínio. (note)
- Resolução de problemas complexos, incluindo raciocínio em múltiplas etapas e chain-of-thought estruturado. (dev.to)
Avaliações de terceiros enfatizam que o GLM-5.2 foi ajustado para engenharia de software em escala de repositório e workflows de agentes de longa duração, e não para conclusão de código em uma única passada — alinhando-se à mensagem da Z.ai de que o GLM foi "deliberadamente construído para desenvolvimento de software e não para puro chat", com codificação, uso de ferramentas e workflows agentic de longo prazo como centro do design. (AI for Anything)
Pesos abertos e licenciamento
Uma das maiores apostas estratégicas do GLM-5.2 está no licenciamento e na distribuição. A Z.ai está comprometida em lançar o GLM-5.2 como um modelo de pesos abertos com licença MIT, seguindo o padrão estabelecido pelo GLM-5 e GLM-5.1. (Gigazine)
- O LLM Reference e os guias para desenvolvedores descrevem o GLM-5.2 como um modelo open source e de pesos abertos sob a licença MIT, com pesos disponíveis no Hugging Face (por exemplo
zai-org/GLM-5.2e variantes FP8). (apidog) - Relatos da mídia no Japão e na China repetem que o GLM-5.2 será publicado como um modelo aberto na terceira semana de junho de 2026, após disponibilidade inicial para assinantes do GLM Coding Plan. (AI for Anything)
Isso importa para o ecossistema: um modelo de codificação de fronteira com pesos abertos, licença MIT e contexto de 1M tokens oferece a desenvolvedores independentes e plataformas open source uma alternativa séria aos modelos fechados para sistemas agentic.
Benchmarks e sinais iniciais de desempenho
No lançamento, a Z.ai notavelmente não publicou um conjunto completo e oficial de benchmarks para o GLM-5.2 — algo que muitos observadores destacaram. Blogs voltados para desenvolvedores enfatizam que a empresa está priorizando "inovações de infraestrutura para 1M de contexto e agentic RL" em vez de gráficos de benchmark nas comunicações técnicas iniciais. (DataCamp)
Dito isso, o LLM Reference e os model cards resumem pontuações autoreportadas que colocam o GLM-5.2 de forma competitiva em benchmarks de codificação e raciocínio — incluindo números fortes em tarefas como SWE-bench Pro, Terminal-Bench e avaliações de uso de ferramentas, embora a verificação independente ainda esteja alcançando esses resultados. Trate os números iniciais como indicativos, e não definitivos, até que avaliações de terceiros sejam publicadas. (LLM Reference)
Se você estiver comparando GLM-5.2 vs GPT-5 vs Claude, a resposta honesta hoje é que temos mais transparência de preços e especificações de contexto para o GLM-5.2 do que benchmarks comparáveis, de terceiros e lado a lado.
Preços e acesso
A Z.ai está disponibilizando o GLM-5.2 amplamente em seus próprios produtos e em plataformas parceiras, muitas vezes no mesmo preço ou em um preço menor do que os modelos GLM-5.x anteriores. (AI for Anything)
Os principais caminhos de acesso incluem:
- GLM Coding Plan (Lite / Pro / Max / Team) — o GLM-5.2 é o novo carro-chefe padrão em todos os planos, disponível diretamente pelas ferramentas de codificação e superfícies de chat da Z.ai. (Gigazine)
- APIs e chat independentes — a Z.ai anunciou que as APIs do GLM-5.2 e o acesso via chat seguirão pouco depois do rollout das ferramentas de codificação. (note)
- Provedores de terceiros — plataformas como OpenRouter e gateways multi-modelo listam o GLM-5.2 por cerca de $1.4 por 1M de tokens de entrada (e mais para saída), posicionando-o como aproximadamente uma ordem de grandeza mais barato do que o GPT-5 ou modelos de fronteira comparáveis em algumas regiões. (Atlas Cloud)
- Workers AI (Cloudflare) — expõe
@cf/zai-org/glm-5.2com function calling e um grande contexto, integrando-o diretamente em edge functions e workflows serverless. (Cloudflare)
Para self-hosting, os pesos abertos e a licença MIT permitem levar o GLM-5.2 para sua própria infraestrutura ou para stacks de inferência especializados, incluindo runtimes otimizados para MoE. (Modular)
Casos de uso: onde o GLM-5.2 se destaca
Para builders de agentes e ferramentas, o GLM-5.2 é mais atraente quando você explora seu contexto longo e foco em codificação.
Agentes de codificação em escala de repositório
A combinação de contexto de 1M, modos de raciocínio High/Max e function calling torna o GLM-5.2 um forte candidato para:
- Refatorações e migrações autônomas de codebases.
- Análise de dependências entre serviços e exploração de superfícies de API.
- Workflows de caça a bugs em múltiplas etapas, espalhados por vários repositórios.
Guias para desenvolvedores destacam que o GLM-5.2 foi testado em tarefas de engenharia em escala de "warehouse", e não em repositórios de brinquedo, com o contexto longo explicitamente destinado a "aguentar projetos reais em vez de desmoronar depois de algumas centenas de milhares de tokens." (dev.to)
Workflows agentic de longo prazo
Como o GLM-5.2 consegue sustentar contextos enormes e expõe controles de raciocínio, ele se encaixa em agentes que:
- Mantêm memórias ricas, em nível de token, de execuções anteriores, em vez de resumir tudo o tempo todo.
- Orquestram workflows com múltiplas ferramentas (APIs, bancos de dados, busca, ferramentas internas) com chamadas de função ao longo de muitas interações. (CometAPI)
- Misturam planejamento e execução no mesmo contexto — armazenando planos, resultados intermediários e logs junto com código-fonte e documentos. (Lush Binary)
Várias análises enquadram o GLM-5.2 como uma resposta à demanda dos desenvolvedores por agentes de "long-run" que possam ficar horas em um problema sem bater em limites rígidos de contexto. (note)
Desenvolvimento e documentação multilíngues
O GLM-5.2 mantém forte suporte multilíngue, com inglês e chinês como idiomas de primeira classe e capacidades multilíngues mais amplas herdadas da linhagem GLM-5. Isso o torna atraente para equipes que trabalham entre codebases e documentações em inglês e chinês, especialmente em contextos open source. (apidog)
Limitações e questões em aberto
O GLM-5.2 é ambicioso, mas alguns pontos de atenção merecem ser considerados:
- Os benchmarks ainda são incompletos. Lançar sem um conjunto de benchmarks abrangente significa que os primeiros adotantes precisam confiar em pontuações autoreportadas e testes anedóticos. (AI Weekly)
- O contexto de 1M nem sempre é exposto por completo. Algumas plataformas, como o Cloudflare Workers AI, atualmente limitam o contexto implantado bem abaixo de 1M (por exemplo, 262k tokens), mesmo que o modelo subjacente suporte mais. (note)
- MoE e inferência de contexto longo exigem muito hardware. Mesmo com as otimizações do IndexShare e do MTP reduzindo os FLOPs por token, uma execução MoE com 1M tokens ainda é cara para hospedar por conta própria em comparação com modelos densos menores — o GLM-5.2 não é um substituto direto para inferência leve em uma única GPU de consumo. (apidog)
Como o GLM-5.2 se encaixa no ecossistema de agentes de IA
Estratégicamente, o GLM-5.2 impulsiona três tendências no espaço de agentes:
- Modelos de fronteira com pesos abertos. O GLM-5.2 mostra que capacidade de codificação e agentic em nível de fronteira, além de contexto de 1M, pode ser lançada sob licenciamento permissivo — dando mais alavancagem aos ecossistemas open source. (Gigazine)
- Posicionamento agent-first. A Z.ai está explicitamente promovendo o GLM-5.2 como um modelo "agent-oriented" otimizado para workflows de longo prazo, e não apenas para chat — exatamente o que builders sérios de automação têm pedido. (Atlas Cloud)
- Contexto como recurso de produto de primeira classe. Em vez de pequenos avanços de marketing, o salto do GLM-5.2 para 1M de tokens utilizáveis — com mudanças de infraestrutura como IndexShare e MTP — sinaliza que a confiabilidade em contexto longo está se tornando uma expectativa básica para plataformas de agentes. (Latent Space)
Para fundadores, builders de plataforma e autores de frameworks de agentes, essa combinação de pesos abertos, ajuste agentic e contexto extremo faz do GLM-5.2 um modelo que vale a pena experimentar — seja como mecanismo principal ou como parte de uma estratégia de roteamento multi-modelo.
Este é exatamente o caso de uma infraestrutura multi-agent agnóstica de modelo. O mercado de modelos muda rápido, e as plataformas que vencem são aquelas que conseguem encaixar um modelo como o GLM-5.2 nos problemas difíceis — sem re-arquitetar toda a stack. Assim como rodamos o MiniMax M2.1 através do CAMEL Workforce da Eigent, um modelo de pesos abertos como o GLM-5.2 entra de forma limpa na mesma camada de orquestração. Se é esse o tipo de base sobre a qual você está construindo, explore como a plataforma open source e multi-agent Eigent permite orquestrar modelos especializados em workflows do mundo real.
Perguntas frequentes
O que é o GLM-5.2?
O GLM-5.2 é o mais recente modelo carro-chefe de pesos abertos da Zhipu AI (Z.ai), ajustado para codificação, raciocínio e uso de ferramentas agentic. Ele usa uma arquitetura Mixture-of-Experts (~753B de parâmetros totais, ~40B ativos por token), vem com uma janela de contexto de 1 milhão de tokens e é lançado sob uma licença open source MIT.
Qual é o tamanho da janela de contexto do GLM-5.2?
O GLM-5.2 suporta uma janela de contexto de 1 milhão de tokens via o ID de modelo glm-5.2[1m] — cerca de cinco vezes maior que a janela anterior do GLM-5.x. Observe que algumas plataformas atualmente expõem menos do que o 1M completo (o Cloudflare Workers AI, por exemplo, o implanta por enquanto em 262k tokens).
O GLM-5.2 é open source?
Sim. A Z.ai está lançando o GLM-5.2 como um modelo de pesos abertos sob a licença MIT, com pesos disponíveis no Hugging Face (por exemplo zai-org/GLM-5.2 e variantes FP8), continuando a abordagem de pesos abertos do GLM-5 e do GLM-5.1.
Quanto custa o GLM-5.2?
A Z.ai inclui o GLM-5.2 como o carro-chefe padrão em seus planos do GLM Coding Plan. Em gateways de terceiros como o OpenRouter, ele aparece por cerca de $1.4 por 1M de tokens de entrada (mais alto para saída) — aproximadamente uma ordem de grandeza mais barato que o GPT-5 ou modelos de fronteira comparáveis em algumas regiões.
Quais são os modos de raciocínio High e Max do GLM-5.2?
São dois níveis de "thinking-effort". O High é o padrão para tarefas de codificação do dia a dia, usando raciocínio chain-of-thought com orçamento limitado para velocidade e confiabilidade. O Max aumenta o orçamento de raciocínio para problemas mais difíceis — bugs não triviais, refatorações entre serviços e planejamento em múltiplas etapas — ao custo de latência e tokens.
Posso usar o GLM-5.2 com a Eigent?
Sim. A arquitetura multi-agent agnóstica de modelo da Eigent permite rotear tarefas para o GLM-5.2 por meio de suas ferramentas MCP e do framework Skills — usando seu contexto longo e foco em codificação para trabalhos em escala de repositório, enquanto mantém outros modelos para tarefas rotineiras.
Recent Posts

ChatGPT no Chrome: Side Chat, Abas Abertas e Histórico do Navegador Explicados
O ChatGPT agora funciona dentro do Chrome com um Side Chat, contexto de abas abertas, YouTube e destacar para perguntar, além de sugestões de URL no desktop e histórico do navegador — veja como.

Claude Opus 5: Inteligência Quase de Ponta pela Metade do Custo
O Claude Opus 5 entrega inteligência próxima ao Fable 5 pela metade do custo, com um controle de esforço para trocar processamento por economia. Especificações, preços e impacto em agentes.

Alternativa ao Cursor (Gratuita e Open Source): O Workspace Que É Seu
Procurando uma alternativa gratuita e open source ao Cursor após a aquisição pela SpaceX? Compare custo, self-hosting, escolha de modelo e residência de dados, além de um caminho de migração.