GLM-5.3-Flash: El Modelo Multimodal de Z.ai a una Décima del Precio
El primer modelo GLM-5 nativamente multimodal — 320B-A18B, licencia MIT, contexto de 1M y precio diseñado para ejecutar agentes todo el día

Z.ai lanzó GLM-5.3-Flash el 26 de agosto de 2026 — el primer modelo nativamente multimodal de su serie GLM-5, publicado bajo licencia MIT con una ventana de contexto de 1M de tokens (Z.ai en X). Es un modelo 320B-A18B que Z.ai afirma supera a GLM-5.2 en pruebas de codificación y agentes a aproximadamente una décima del precio. Aquí está lo que realmente es nuevo, los benchmarks que importan para los agentes, cuánto cuesta y en qué se diferencia de GLM-5.3.
¿Qué es GLM-5.3-Flash?
GLM-5.3-Flash es un modelo de Mezcla de Expertos (Mixture-of-Experts) con 320 mil millones de parámetros totales y 18 mil millones de parámetros activos por token (TestingCatalog). Z.ai lo posiciona como el nivel de menor costo y mayor eficiencia de la familia GLM-5: rendimiento sólido en codificación y tareas agénticas, pero diseñado para ejecutarse de forma económica y responder rápido.
Dos aspectos lo distinguen de versiones anteriores de GLM. Es el primer modelo nativamente multimodal de la línea — la visión está integrada en el entrenamiento, no añadida como complemento — y se publica bajo licencia MIT con pesos abiertos en Hugging Face. Si el nombre "Ox Alpha" le resulta familiar, es porque se trata del mismo modelo: funcionó de forma anónima como ox-alpha en OpenCode y OpenRouter durante aproximadamente una semana antes de la revelación.
La arquitectura híbrida: atención más económica a 1M de tokens
La historia de eficiencia comienza con el diseño de atención. GLM-5.3-Flash es, según Z.ai, el primer modelo de frontera de código abierto que combina atención dispersa (sparse attention) y atención lineal (linear attention) en una arquitectura híbrida — atención lineal para dependencias locales, atención dispersa para el contexto global relevante (documentación de Z.ai).
El beneficio es concreto. En comparación con GLM-5.3, Z.ai reporta aproximadamente 3 veces menos cómputo de atención y una caché KV 4,4 veces más pequeña (TestingCatalog). En longitudes de contexto que alcanzan el millón de tokens, un componente que Z.ai denomina IndexPool comprime grupos de vectores clave de indexación para controlar la latencia y la memoria. Eso es lo que hace que una ventana de 1M de tokens sea utilizable en la práctica y no solo en una hoja de especificaciones — los agentes de largo horizonte pueden mantener más contexto cargado sin que el costo se dispare.
El modelo fue entrenado en un corpus multimodal de 30 billones de tokens, y Z.ai afirma que parte de una base recién entrenada en lugar de reutilizar la de GLM-5.2 — una diferencia respecto a la fórmula de GLM-5.3, que reutilizó la base de GLM-5.2 y solo escaló el post-entrenamiento.
Benchmarks de GLM-5.3-Flash
Todos los números a continuación son reportados por el proveedor o por rastreadores de terceros; los entornos de prueba y configuraciones difieren, por lo que deben interpretarse como indicativos y no como comparaciones directas.
En suites de codificación y agentes frente a GLM-5.2, las mejoras son significativas y no meramente incrementales (OfficeChai):
- DeepSWE v1.1: 46,2 → 63,4
- AutomationBench: 26,2 → 48,8 (casi el doble)
- Terminal-Bench 2.1: 84,3 — por delante de DeepSeek-V4-Vision-Exp y muy cerca de Claude Opus 4.8 con 85,0
En la misma prueba Terminal-Bench, GPT-5.6 Terra (87,4) y Gemini 3.7 Flash (85,8) aún llevan ventaja, pero el margen se ha reducido considerablemente respecto a donde se encontraba GLM-5.2. En el propio Code Bench v1.0 interno de Z.ai — ejecutado dentro de Claude Code — GLM-5.3-Flash alcanza 29,0 en máximo esfuerzo frente al 29,5 de Opus 4.8, lo que la empresa señala como evidencia de que su modelo de nivel flash ahora compite de igual a igual con un modelo de frontera en codificación.
En el Artificial Analysis Intelligence Index independiente, GLM-5.3-Flash obtiene una puntuación de 57 — muy por encima de la mediana para modelos de razonamiento en su rango de precio. La advertencia honesta: los benchmarks internos como Code Bench no pueden replicarse de forma independiente, y el modelo no pretende superar a GPT-5.6 Sol o Fable 5 en las suites públicas más exigentes. Es una propuesta de valor, no una apuesta por encabezar clasificaciones.
Multimodal nativo: visión integrada en el ciclo de codificación
La capacidad multimodal no es una función separada — está integrada en el funcionamiento del modelo. Z.ai entrenó GLM-5.3-Flash para inspeccionar interfaces renderizadas, gameplay y salidas 3D, y luego evaluar y revisar su propio trabajo a partir de esa retroalimentación visual (TestingCatalog).
Ese ciclo de "ver el resultado y luego corregirlo" importa para los agentes que construyen interfaces de usuario o dashboards: el modelo puede ver la página renderizada, detectar que algo está mal e iterar. El mismo enfoque se extiende más allá del código a documentos, hojas de cálculo, presentaciones y materiales de reuniones — de modo que el modelo puede razonar sobre texto, imágenes y estructura, y entregar archivos PPTX, PDF, DOCX y XLSX terminados de principio a fin (documentación de Z.ai).
¿Cuánto cuesta GLM-5.3-Flash?
El precio es el titular. Las tarifas estándar de la API de Z.ai son $0,15 por 1M de tokens de entrada y $0,50 por 1M de salida, con entrada en caché a $0,03 (Z.ai en X). Los proveedores de terceros lo ofrecen aún más bajo — OpenRouter muestra $0,075 entrada / $0,25 salida (OpenRouter).
Para los suscriptores del GLM Coding Plan, ya está disponible con 3 veces la cuota utilizable de GLM-5.3 (TestingCatalog). Esa es la diferencia práctica respecto a los niveles más costosos: puedes ejecutar ciclos de agentes largos sin estar pendiente de un contador de tokens.
GLM-5.3-Flash vs GLM-5.3
Están diseñados para trabajos diferentes. GLM-5.3 es el modelo de codificación con razonamiento intensivo — el que desarrolló de forma no planificada una habilidad en ciberseguridad y tuvo sus pesos escalonados para revisión de seguridad. GLM-5.3-Flash es la variante eficiente, multimodal y con licencia MIT, pensada para ejecutarse de forma económica a escala.
El contraste rápido:
- Modalidad: GLM-5.3 está orientado al texto; GLM-5.3-Flash es nativamente multimodal.
- Arquitectura: GLM-5.3 reutiliza la base de GLM-5.2; GLM-5.3-Flash usa una base recién entrenada con atención híbrida dispersa + lineal.
- Eficiencia: GLM-5.3-Flash reporta ~3 veces menos cómputo de atención y una caché KV 4,4 veces más pequeña que GLM-5.3.
- Licencia y pesos: GLM-5.3-Flash se publica con licencia MIT y pesos abiertos desde el primer día; los pesos de GLM-5.3 fueron escalonados.
- Costo: GLM-5.3-Flash tiene precio para volumen — aproximadamente una décima del costo de GLM-5.2, según Z.ai.
Si necesitas el razonamiento más profundo para un problema difícil, GLM-5.3 es la elección. Si estás ejecutando agentes multimodales o de largo horizonte donde el costo por tarea determina si el flujo de trabajo es viable, GLM-5.3-Flash es el que debes probar.
Qué significa si construyes agentes de IA
Algunas conclusiones prácticas:
- Este es un factor de reducción de costos para agentes de todo el día. A $0,075–$0,15 por 1M de tokens de entrada con una ventana real de 1M de tokens, GLM-5.3-Flash hace que los ciclos de agentes de larga duración sean asequibles de una manera que los modelos de frontera no permiten.
- El multimodal cambia lo que los agentes pueden verificar. Un modelo que puede ver una interfaz renderizada y corregirla cierra un ciclo que los agentes solo de texto no pueden — útil para trabajo de UI, dashboards y documentos.
- La licencia MIT elimina fricciones. Los pesos abiertos bajo una licencia permisiva significan que los equipos con reglas de residencia de datos o revisión de proveedores pueden auto-alojar desde el primer día; el despliegue local es compatible con SGLang, vLLM y TokenSpeed.
- Trata los benchmarks internos como punto de partida. Los números de Code Bench son privados y recientes. Las pruebas independientes apenas están comenzando ahora que los pesos están disponibles.
Ejecuta un modelo como GLM-5.3-Flash en tu propia fuerza de trabajo de IA
GLM-5.3-Flash está diseñado exactamente para el trabajo que Eigent orquesta: ciclos de agentes económicos, de largo horizonte y multimodales que se ejecutan de principio a fin en lugar de responder un solo prompt. Eigent es una aplicación de escritorio "Cowork" local y de código abierto que convierte modelos como estos en una fuerza de trabajo multi-agente — desde revisar PRs de GitHub hasta ejecutar un agente de codificación de IA auto-alojado que controlas completamente. Trae tu propio modelo, mantén el trabajo en tu máquina. Descarga Eigent y construye tus propios flujos de trabajo de agentes hoy.
Recent Posts

Cursor Origin: El Forge de Git Creado para Agentes de IA, Explicado
Cursor Origin es un forge de git para la era agéntica. Descubre qué se lanzó en la beta temprana, cómo funciona el espejo de GitHub, qué pueden hacer los agentes y qué sigue faltando hoy.

Slack Code: Los Agentes de Codificación con IA se Vuelven Multijugador
Slack Code incorpora agentes de codificación con IA en canales compartidos para que los equipos planifiquen, revisen y publiquen juntos. Así funcionan los canales de código, para quién son y sus ventajas y desventajas.

GLM-5.3: El modelo de codificación de Z.ai que desarrolló una habilidad cibernética inesperada
GLM-5.3 explicado: cómo el modelo de pesos abiertos de Z.ai supera a GLM-5.2 en codificación de largo horizonte, por qué su capacidad cibernética sorprendió al equipo y cuándo se publican los pesos.