GLM-5.2: El modelo de código y agentic de 1M tokens de peso abierto de Zhipu AI
El buque insignia de Zhipu con licencia MIT está diseñado para coding, uso de herramientas y agentes de largo recorrido — esto es lo que significa para los builders

Zhipu AI acaba de lanzar un modelo de peso abierto que parece diseñado para agentes más que para chat. GLM-5.2 es el último buque insignia de Zhipu — creado específicamente para coding, razonamiento y cargas de trabajo "agentic" impulsadas por herramientas — y llega con una ventana de contexto de 1 millón de tokens bajo una licencia MIT de código abierto. Lanzado el 13 de junio de 2026, sucede a GLM-5.1 en la familia GLM-5 y ya está disponible en el GLM Coding Plan de Z.ai y en múltiples plataformas de terceros. (apidog)
Si estás creando agentes de IA, herramientas de coding autónomas o flujos de trabajo de largo recorrido, GLM-5.2 es uno de los primeros modelos de peso abierto que parece hecho para tu caso de uso, no adaptado a partir de un asistente genérico. Esta guía desglosa qué es realmente GLM-5.2, su arquitectura y ventana de contexto, los modos de razonamiento, el precio, la situación inicial de los benchmarks y los patrones que están usando los builders para sacar el máximo partido dentro de plataformas de agentes como Eigent.
¿Qué es GLM-5.2?
GLM-5.2 es un modelo de lenguaje grande de pesos abiertos de Zhipu AI (que opera globalmente como Z.ai), ajustado intensivamente para ingeniería de software, razonamiento en varios pasos y trabajo de agentes con herramientas. Se basa en la arquitectura Mixture-of-Experts (MoE) introducida con GLM-5 y GLM-5.1, pero amplía la ventana de contexto hasta un millón de tokens utilizable, manteniendo un rendimiento sólido en coding. (Modular)
Por dentro, GLM-5.2 usa alrededor de 750B parámetros en un diseño MoE disperso, con unos 40B parámetros activos por token, combinado con una nueva técnica de atención dispersa llamada "IndexShare" diseñada para mantener bajo control los costes de inferencia con contexto de 1M. Zhipu posiciona el modelo como un sistema centrado en coding y orientado a agentes, en lugar de un modelo de chat de propósito general: la conversación se trata como un subproducto de construir un motor fuerte enfocado en desarrolladores. (LLM Reference)
Ese enfoque agent-first coloca a GLM-5.2 en la misma conversación que Claude Fable 5 de Anthropic: modelos de frontera cada vez más diseñados primero para agentes de largo recorrido, con el chat como interfaz secundaria.
Especificaciones clave y arquitectura
Las características principales de GLM-5.2 giran en torno al contexto, el razonamiento y la apertura. (DataCamp)
- Ventana de contexto de 1M tokens mediante el ID de modelo
glm-5.2[1m]— suficiente para repositorios monolíticos completos, documentos grandes o estado de agentes de larga duración. (note) - Hasta 131,072 tokens de salida por respuesta — suficiente para generar o refactorizar archivos muy grandes en una sola pasada. (Lush Binary)
- Diseño MoE con aproximadamente 753B parámetros totales y unos 40B activos por token, reutilizando la base de GLM-5.1. (dev.to)
- IndexShare — un esquema de atención dispersa que reutiliza el mismo indexador de atención en múltiples capas dispersas, reduciendo los FLOPs por token en longitudes de contexto largas. (Latent Space)
- Capas mejoradas de predicción multi-token (MTP) para decoding especulativo, que según informes aumentan las tasas de aceptación hasta en un ~20% y mejoran el throughput. (Latent Space)
Z.ai ha destacado que GLM-5.2 mantiene el "ADN de peso abierto y centrado en coding" de la serie GLM-5, al tiempo que mejora la ventana de contexto y los controles de razonamiento en lugar de perseguir una arquitectura completamente nueva. (Modular)
Contexto de 1M tokens: por qué importa
La ventana de contexto de 1 millón de tokens es el diferenciador más evidente de GLM-5.2. Eso es alrededor de cinco veces más que la ventana anterior de GLM-5.x y sitúa a GLM-5.2 entre las ventanas de contexto utilizables públicamente más grandes del ecosistema de pesos abiertos. (LLM Reference)
En la práctica, esto desbloquea varios flujos de trabajo que históricamente han sido frágiles:
- Comprensión de código a escala de repositorio — cargar servicios completos, monorepos o clústeres de microservicios en un solo contexto sin truncamiento agresivo. (Lush Binary)
- Agentes de larga duración — los agentes pueden mantener memoria de trabajo de varios días o varias sesiones en el contexto, en lugar de comprimirlo todo en resúmenes específicos de herramientas. (CometAPI)
- Análisis de documentos complejos — corpus legales, estándares técnicos o PDFs de miles de páginas se vuelven manejables de una sola vez en lugar de mediante pipelines de fragmentación y ensamblado. (CometAPI)
La integración de Cloudflare Workers AI es una señal útil aquí: expone GLM-5.2 con function calling, soporte de reasoning y un contexto grande (la implementación actual es de 262k tokens, con planes de ampliarlo), apuntando específicamente a codebases largas y planificación en varios pasos. Eso apunta a un modelo ajustado para cargas de trabajo sostenidas y de alto contexto, no solo a un número de "1M" a nivel de marketing. (Cloudflare)
Dos modos de razonamiento: High vs Max
GLM-5.2 introduce un sistema de "thinking-effort" de dos niveles: High y Max. (AI Weekly)
- High es el modo predeterminado para la mayoría de las tareas de coding, usando razonamiento estructurado tipo chain-of-thought antes de responder, pero con un presupuesto de razonamiento limitado. Z.ai lo recomienda para generación de código cotidiana, refactorización y depuración cuando quieres fiabilidad y velocidad. (DataCamp)
- Max eleva el presupuesto de razonamiento para problemas más complejos y secuencias agentic más largas, a costa de latencia y tokens. Está orientado a bugs no triviales, refactors entre servicios, cambios de arquitectura y planificación en varios pasos. (AI Weekly)
Desde la perspectiva del diseño de agentes, esto te da una palanca para ajustar la profundidad del razonamiento a la dificultad de la tarea sin cambiar de modelo. Puedes enrutar operaciones rutinarias a través de High y escalar tickets complicados, pasos de planificación o intentos fallidos a Max: una versión de un solo modelo del patrón de clasificación y enrutamiento del que ya dependen los sistemas agentic serios.
Capacidades agentic y uso de herramientas
Zhipu presenta GLM-5.2 como un modelo "orientado a agentes", diseñado para admitir flujos de trabajo autónomos, agentes potenciados por herramientas y tareas de coding de largo recorrido. (Atlas Cloud)
La implementación de Cloudflare describe @cf/zai-org/glm-5.2 como un modelo de generación de texto "construido para flujos de trabajo de coding agentic", con soporte de primera clase para function calling y uso de herramientas en múltiples turnos. Señala específicamente: (Cloudflare)
- Function calling para invocar herramientas y APIs a lo largo de múltiples turnos de conversación, habilitando bucles clásicos de uso de herramientas en agentes.
- Planificación de largo recorrido sobre codebases grandes, impulsada por el contexto de 1M y los modos de razonamiento. (note)
- Resolución de problemas complejos, incluyendo razonamiento en varios pasos y chain-of-thought estructurado. (dev.to)
Las reseñas de terceros destacan que GLM-5.2 está ajustado para ingeniería de software a escala de repositorio y flujos de trabajo de agentes de larga duración, en lugar de autocompletado de código de una sola pasada, alineándose con el mensaje de Z.ai de que GLM está "construido deliberadamente para desarrollo de software en lugar de chat puro", con coding, uso de herramientas y flujos de trabajo de agentes de larga duración como centro de diseño. (AI for Anything)
Pesos abiertos y licencia
Uno de los movimientos estratégicos más importantes de GLM-5.2 es su licencia y distribución. Z.ai se compromete a lanzar GLM-5.2 como un modelo de pesos abiertos con licencia MIT, siguiendo el patrón marcado por GLM-5 y GLM-5.1. (Gigazine)
- LLM Reference y las guías para desarrolladores describen GLM-5.2 como un modelo de código abierto y pesos abiertos bajo la licencia MIT, con pesos disponibles en Hugging Face (por ejemplo
zai-org/GLM-5.2y variantes FP8). (apidog) - La cobertura mediática en Japón y China indica que GLM-5.2 se publicará como modelo abierto en la tercera semana de junio de 2026, tras la disponibilidad inicial para suscriptores del GLM Coding Plan. (AI for Anything)
Esto importa para el ecosistema: un modelo de peso abierto, con licencia MIT, de clase frontera para coding y con contexto de 1M tokens ofrece a los desarrolladores independientes y a las plataformas de código abierto una alternativa seria a los modelos cerrados para sistemas agentic.
Benchmarks y primeras señales de rendimiento
En el lanzamiento, Z.ai notablemente no publicó un conjunto completo y oficial de benchmarks para GLM-5.2, algo que muchos observadores han señalado. Los blogs orientados a desarrolladores subrayan que la empresa está enfatizando "innovaciones de infraestructura para contexto 1M y RL agentic" por encima de gráficos de benchmarks en sus comunicaciones técnicas iniciales. (DataCamp)
Dicho esto, LLM Reference y las fichas del modelo resumen puntuaciones autoinformadas que sitúan a GLM-5.2 de forma competitiva en benchmarks de coding y razonamiento, incluidas cifras sólidas en tareas como SWE-bench Pro, Terminal-Bench y evaluaciones de uso de herramientas, aunque la verificación independiente todavía está poniéndose al día. Toma los primeros números como orientativos y no definitivos hasta que lleguen evaluaciones de terceros. (LLM Reference)
Si estás comparando GLM-5.2 vs GPT-5 vs Claude, la respuesta honesta hoy es que tenemos más transparencia sobre precios y especificaciones de contexto para GLM-5.2 que benchmarks comparables y de terceros.
Precios y acceso
Z.ai está desplegando GLM-5.2 ampliamente en sus propios productos y en plataformas asociadas, a menudo al mismo precio o a un precio inferior al de los modelos anteriores GLM-5.x. (AI for Anything)
Las principales vías de acceso incluyen:
- GLM Coding Plan (Lite / Pro / Max / Team) — GLM-5.2 es el nuevo buque insignia predeterminado en todos los niveles, disponible directamente a través de las herramientas de coding y las superficies de chat de Z.ai. (Gigazine)
- APIs y chat independientes — Z.ai ha anunciado que las APIs de GLM-5.2 y el acceso por chat llegarán poco después del despliegue en las herramientas de coding. (note)
- Proveedores de terceros — plataformas como OpenRouter y gateways multmodelo listan GLM-5.2 en torno a $1.4 por 1M de tokens de entrada (y más para salida), posicionándolo como aproximadamente una orden de magnitud más barato que GPT-5 o modelos de frontera comparables en algunas regiones. (Atlas Cloud)
- Workers AI (Cloudflare) — expone
@cf/zai-org/glm-5.2con function calling y un contexto grande, integrándose directamente en funciones edge y flujos de trabajo serverless. (Cloudflare)
Para self-hosting, los pesos abiertos y la licencia MIT te permiten llevar GLM-5.2 a tu propia infraestructura o a stacks de inferencia especializados, incluidos runtimes optimizados para MoE. (Modular)
Casos de uso: dónde destaca GLM-5.2
Para los builders de agentes y herramientas, GLM-5.2 resulta más convincente cuando aprovechas su largo contexto y su enfoque en coding.
Agentes de coding a escala de repositorio
La combinación de contexto de 1M, modos de razonamiento High/Max y function calling convierte a GLM-5.2 en un candidato sólido para:
- Refactors y migraciones autónomas de codebases.
- Análisis de dependencias entre servicios y exploración de superficies de API.
- Flujos de trabajo de búsqueda de bugs en varios pasos a través de múltiples repositorios.
Las guías para desarrolladores destacan que GLM-5.2 se probó en tareas de ingeniería a escala "warehouse-scale" en lugar de repositorios de juguete, con el contexto largo diseñado explícitamente para "resistir en repositorios reales en lugar de desmoronarse al pasar unos pocos cientos de miles de tokens". (dev.to)
Flujos de trabajo de agentes de largo recorrido
Como GLM-5.2 puede sostener contextos enormes y expone controles de razonamiento, encaja con agentes que:
- Mantienen memorias ricas, a nivel de token, de ejecuciones previas en lugar de resumir constantemente.
- Orquestan flujos de trabajo multiherramienta (APIs, bases de datos, búsqueda, herramientas internas) mediante function calls durante muchos turnos. (CometAPI)
- Mezclan planificación y ejecución en el mismo contexto: almacenando planes, resultados intermedios y logs junto con código fuente y documentos. (Lush Binary)
Varias reseñas presentan GLM-5.2 como una respuesta a la demanda de desarrolladores por agentes de "largo recorrido" que puedan mantenerse sobre un problema durante horas sin alcanzar límites duros de contexto. (note)
Desarrollo y documentación multilingüe
GLM-5.2 mantiene un sólido soporte multilingüe, con inglés y chino como idiomas de primera clase y capacidades multilingües más amplias heredadas del linaje GLM-5. Eso lo hace atractivo para equipos que trabajan entre codebases y documentación en inglés y chino, especialmente en entornos de código abierto. (apidog)
Limitaciones y preguntas abiertas
GLM-5.2 es ambicioso, pero conviene tener en cuenta algunas advertencias:
- Los benchmarks siguen incompletos. Lanzarlo sin un conjunto de benchmarks completo significa que los primeros adoptantes deben apoyarse en puntuaciones autoinformadas y pruebas anecdóticas. (AI Weekly)
- El contexto de 1M no siempre se expone completo. Algunas plataformas, como Cloudflare Workers AI, actualmente limitan el contexto desplegado muy por debajo de 1M (por ejemplo, 262k tokens), aunque el modelo subyacente admita más. (note)
- MoE y la inferencia de largo contexto requieren mucho hardware. Incluso con IndexShare y optimizaciones MTP reduciendo los FLOPs por token, una ejecución MoE de 1M tokens sigue siendo cara de alojar por tu cuenta en comparación con modelos densos más pequeños: GLM-5.2 no es un reemplazo directo para inferencia ligera en una sola GPU de consumo. (apidog)
Cómo encaja GLM-5.2 en el ecosistema de agentes de IA
Estratégicamente, GLM-5.2 impulsa tres tendencias en el espacio de agentes:
- Modelos de frontera con pesos abiertos. GLM-5.2 demuestra que la capacidad de coding y agentic de clase frontera, más el contexto de 1M, puede lanzarse con licencias permisivas, dando más ventaja a los ecosistemas de código abierto. (Gigazine)
- Posicionamiento agent-first. Z.ai está presentando explícitamente GLM-5.2 como un modelo "orientado a agentes" optimizado para flujos de trabajo de largo recorrido, no solo para chat, alineándose con lo que los builders serios de automatización están pidiendo. (Atlas Cloud)
- El contexto como función de producto de primera clase. En lugar de pequeños saltos de marketing, el salto de GLM-5.2 a 1M tokens utilizables —con cambios de infraestructura como IndexShare y MTP— señala que la fiabilidad de largo contexto se está convirtiendo en una expectativa base para las plataformas de agentes. (Latent Space)
Para fundadores, builders de plataformas y autores de frameworks de agentes, esa combinación de pesos abiertos, ajuste agentic y contexto extremo hace de GLM-5.2 un modelo que merece la pena probar, ya sea como motor principal o como parte de una estrategia de enrutamiento multmodelo.
Este es exactamente el caso de una infraestructura multi-agent agnóstica al modelo. El panorama de modelos se mueve rápido, y las plataformas que ganan son las que pueden incorporar un modelo como GLM-5.2 para los problemas difíciles, sin re-arquitecturar toda la stack. Igual que ejecutamos MiniMax M2.1 a través de CAMEL Workforce de Eigent, un modelo de peso abierto como GLM-5.2 encaja limpiamente en la misma capa de orquestación. Si ese es el tipo de base sobre la que estás construyendo, explora cómo la plataforma multi-agent de código abierto Eigent te permite orquestar modelos especializados en flujos de trabajo del mundo real.
Preguntas frecuentes
¿Qué es GLM-5.2?
GLM-5.2 es el último modelo insignia de pesos abiertos de Zhipu AI (Z.ai), ajustado para coding, razonamiento y uso de herramientas agentic. Usa una arquitectura Mixture-of-Experts (~753B parámetros totales, ~40B activos por token), incluye una ventana de contexto de 1 millón de tokens y se publica bajo una licencia MIT de código abierto.
¿Qué tamaño tiene la ventana de contexto de GLM-5.2?
GLM-5.2 admite una ventana de contexto de 1 millón de tokens mediante el ID de modelo glm-5.2[1m], aproximadamente cinco veces más grande que la ventana anterior de GLM-5.x. Ten en cuenta que algunas plataformas actualmente exponen menos que el 1M completo (Cloudflare Workers AI, por ejemplo, lo despliega por ahora a 262k tokens).
¿GLM-5.2 es open source?
Sí. Z.ai está lanzando GLM-5.2 como un modelo de pesos abiertos bajo la licencia MIT, con pesos disponibles en Hugging Face (por ejemplo zai-org/GLM-5.2 y variantes FP8), continuando el enfoque de pesos abiertos de GLM-5 y GLM-5.1.
¿Cuánto cuesta GLM-5.2?
Z.ai incluye GLM-5.2 como el buque insignia predeterminado en los niveles de su GLM Coding Plan. En gateways de terceros como OpenRouter, aparece en torno a $1.4 por 1M tokens de entrada (más alto para salida), aproximadamente una orden de magnitud más barato que GPT-5 o modelos de frontera comparables en algunas regiones.
¿Qué son los modos de razonamiento High y Max de GLM-5.2?
Son dos niveles de "thinking-effort". High es el predeterminado para tareas de coding cotidianas, usando reasoning tipo chain-of-thought con un presupuesto limitado para ofrecer velocidad y fiabilidad. Max eleva el presupuesto de razonamiento para problemas más difíciles —bugs no triviales, refactors entre servicios y planificación en varios pasos— a costa de latencia y tokens.
¿Puedo usar GLM-5.2 con Eigent?
Sí. La arquitectura multi-agent agnóstica al modelo de Eigent te permite enrutar tareas a GLM-5.2 a través de sus herramientas MCP y el framework Skills, aprovechando su contexto largo y su enfoque en coding para trabajo a escala de repositorio mientras mantienes otros modelos para tareas rutinarias.
Recent Posts

ChatGPT en Chrome: Chat Lateral, Pestañas Abiertas e Historial del Navegador Explicados
ChatGPT ahora funciona dentro de Chrome con un Chat Lateral, contexto de pestañas abiertas, YouTube y selección de texto para preguntar, además de sugerencias de URL en escritorio e historial del navegador — así es como funciona.

Claude Opus 5: Inteligencia casi de vanguardia a la mitad del costo
Claude Opus 5 ofrece una inteligencia cercana a Fable 5 a la mitad del costo, con un dial de esfuerzo para intercambiar cómputo por ahorro. Especificaciones, precios e impacto en agentes.

Alternativa a Cursor (Gratuita y de Código Abierto): El Espacio de Trabajo que Tú Controlas
¿Buscas una alternativa gratuita y de código abierto a Cursor tras la adquisición por SpaceX? Compara costes, autoalojamiento, elección de modelo y residencia de datos, además de una ruta de migración.