GLM-5.3-Flash : le modèle multimodal de Z.ai à un dixième du prix
Le premier modèle GLM-5 nativement multimodal — 320B-A18B, licence MIT, contexte 1M, et tarifé pour faire tourner des agents toute la journée

Z.ai a lancé GLM-5.3-Flash le 26 août 2026 — le premier modèle nativement multimodal de sa série GLM-5, publié sous licence MIT avec une fenêtre de contexte de 1M tokens (Z.ai sur X). C'est un modèle 320B-A18B que Z.ai affirme surpasser GLM-5.2 sur les tests de codage et d'agents à environ un dixième du prix. Voici ce qui est réellement nouveau, les benchmarks qui comptent pour les agents, ce que ça coûte, et en quoi il diffère de GLM-5.3.
Qu'est-ce que GLM-5.3-Flash ?
GLM-5.3-Flash est un modèle Mixture-of-Experts (mélange d'experts) avec 320 milliards de paramètres totaux et 18 milliards de paramètres actifs par token (TestingCatalog). Z.ai le positionne comme le niveau le plus économique et le plus efficace de la famille GLM-5 : de solides performances en codage et en agents, mais conçu pour fonctionner à faible coût et répondre rapidement.
Deux éléments le distinguent des versions GLM précédentes. C'est le premier modèle nativement multimodal de la gamme — la vision est intégrée à l'entraînement, pas ajoutée après coup — et il est livré sous licence MIT avec des poids ouverts sur Hugging Face. Si le nom « Ox Alpha » vous dit quelque chose, c'est parce qu'il s'agit du même modèle : il a fonctionné anonymement sous le nom ox-alpha sur OpenCode et OpenRouter pendant environ une semaine avant la révélation.
L'architecture hybride : une attention moins coûteuse à 1M tokens
L'histoire d'efficacité commence par la conception de l'attention. GLM-5.3-Flash est, selon Z.ai, le premier modèle frontier open source à combiner attention sparse (clairsemée) et attention linéaire dans une architecture hybride unique — l'attention linéaire pour les dépendances locales, l'attention sparse pour le contexte global pertinent (Z.ai docs).
Le bénéfice est concret. Par rapport à GLM-5.3, Z.ai rapporte environ 3x moins de calcul d'attention et un cache KV 4,4x plus petit (TestingCatalog). Pour des longueurs de contexte atteignant un million de tokens, un composant que Z.ai appelle IndexPool compresse des groupes de vecteurs de clés d'indexation pour contenir la latence et la mémoire. C'est ce qui rend une fenêtre de 1M tokens réellement utilisable en pratique plutôt que simplement sur une fiche technique — les agents à long horizon peuvent garder plus de contexte chargé sans que le coût explose.
Le modèle a été entraîné sur un corpus multimodal de 30 billions de tokens, et Z.ai indique qu'il part d'une base nouvellement entraînée plutôt que de réutiliser celle de GLM-5.2 — une rupture avec la recette GLM-5.3, qui réutilisait la base GLM-5.2 et ne faisait évoluer que le post-entraînement.
Benchmarks de GLM-5.3-Flash
Tous les chiffres ci-dessous sont rapportés par le fournisseur ou issus de trackers tiers ; les environnements de test et les paramètres diffèrent, donc lisez-les comme des indications directionnelles plutôt que comme des comparaisons tête-à-tête.
Sur les suites de codage et d'agents par rapport à GLM-5.2, les gains sont importants plutôt qu'incrémentaux (OfficeChai) :
- DeepSWE v1.1 : 46,2 → 63,4
- AutomationBench : 26,2 → 48,8 (presque le double)
- Terminal-Bench 2.1 : 84,3 — devant DeepSeek-V4-Vision-Exp et à portée de Claude Opus 4.8 (85,0)
Sur le même test Terminal-Bench, GPT-5.6 Terra (87,4) et Gemini 3.7 Flash (85,8) gardent encore l'avantage, mais l'écart s'est considérablement réduit par rapport à la position de GLM-5.2. Sur le Code Bench v1.0 interne de Z.ai — exécuté dans Claude Code — GLM-5.3-Flash atteint 29,0 en effort maximal contre 29,5 pour Opus 4.8, ce que l'entreprise présente comme la preuve que son modèle flash rivalise désormais avec un modèle frontier en codage.
Sur l'Artificial Analysis Intelligence Index indépendant, GLM-5.3-Flash obtient un score de 57 — bien au-dessus de la médiane pour les modèles de raisonnement dans sa tranche de prix. La mise en garde honnête : les benchmarks internes comme Code Bench ne peuvent pas être reproduits indépendamment, et le modèle ne prétend pas dominer GPT-5.6 Sol ou Fable 5 sur les suites publiques les plus difficiles. C'est un choix axé sur la valeur, pas sur le classement.
Multimodal natif : la vision intégrée dans la boucle de codage
La capacité multimodale n'est pas une fonctionnalité séparée — elle est câblée dans le fonctionnement du modèle. Z.ai a entraîné GLM-5.3-Flash à inspecter les interfaces rendues, les jeux et les sorties 3D, puis à évaluer et réviser son propre travail à partir de ce retour visuel (TestingCatalog).
Cette boucle « regarder le résultat, puis le corriger » est importante pour les agents qui construisent des interfaces utilisateur ou des tableaux de bord : le modèle peut voir la page rendue, remarquer qu'elle est incorrecte, et itérer. La même approche s'étend au-delà du code aux documents, feuilles de calcul, présentations et supports de réunion — le modèle peut donc raisonner sur du texte, des images et des structures, et livrer des fichiers PPTX, PDF, DOCX et XLSX complets de bout en bout (Z.ai docs).
Combien coûte GLM-5.3-Flash ?
La tarification est le point fort. Les tarifs API standard de Z.ai sont de 0,15 $ par 1M tokens en entrée et 0,50 $ par 1M tokens en sortie, avec l'entrée en cache à 0,03 $ (Z.ai sur X). Les fournisseurs tiers l'affichent encore moins cher — OpenRouter indique 0,075 $ en entrée / 0,25 $ en sortie (OpenRouter).
Pour les abonnés au GLM Coding Plan, il est déjà disponible avec 3x le quota utilisable de GLM-5.3 (TestingCatalog). C'est la différence pratique par rapport aux niveaux plus chers : vous pouvez exécuter de longues boucles d'agents sans surveiller un compteur de tokens.
GLM-5.3-Flash vs GLM-5.3
Ils sont conçus pour des tâches différentes. GLM-5.3 est le modèle de codage à raisonnement intensif — celui qui a développé une compétence en cybersécurité non planifiée et dont les poids ont été mis en attente pour examen de sécurité. GLM-5.3-Flash est la variante efficace, multimodale et sous licence MIT, conçue pour fonctionner à faible coût à grande échelle.
Le contraste rapide :
- Modalité : GLM-5.3 est axé sur le texte ; GLM-5.3-Flash est nativement multimodal.
- Architecture : GLM-5.3 réutilise la base GLM-5.2 ; GLM-5.3-Flash utilise une base nouvellement entraînée avec une attention hybride sparse + linéaire.
- Efficacité : GLM-5.3-Flash rapporte environ 3x moins de calcul d'attention et un cache KV 4,4x plus petit que GLM-5.3.
- Licence et poids : GLM-5.3-Flash est livré sous licence MIT avec des poids ouverts dès le premier jour ; les poids de GLM-5.3 ont été mis en attente.
- Coût : GLM-5.3-Flash est tarifé pour le volume — environ un dixième du coût de GLM-5.2, selon Z.ai.
Si vous avez besoin du raisonnement le plus profond sur un problème difficile, GLM-5.3 est le choix. Si vous exécutez des agents multimodaux ou à long horizon où le coût par tâche détermine si le flux de travail est viable, GLM-5.3-Flash est celui à tester.
Ce que cela signifie si vous construisez des agents IA
Quelques points pratiques à retenir :
- C'est un levier de coût pour les agents toute la journée. À 0,075–0,15 $ par 1M tokens en entrée avec une vraie fenêtre de 1M tokens, GLM-5.3-Flash rend les boucles d'agents longue durée abordables d'une manière que les modèles frontier ne permettent pas.
- Le multimodal change ce que les agents peuvent vérifier. Un modèle capable de voir une interface rendue et de la corriger ferme une boucle que les agents texte seul ne peuvent pas — utile pour les interfaces utilisateur, les tableaux de bord et le travail sur les documents.
- La licence MIT supprime les frictions. Les poids ouverts sous une licence permissive signifient que les équipes soumises à des règles de résidence des données ou d'examen des fournisseurs peuvent s'auto-héberger dès le premier jour ; le déploiement local prend en charge SGLang, vLLM et TokenSpeed.
- Traitez les benchmarks internes comme un point de départ. Les chiffres de Code Bench sont privés et récents. Les tests indépendants ne font que commencer maintenant que les poids sont disponibles.
Faites tourner un modèle comme GLM-5.3-Flash dans votre propre équipe IA
GLM-5.3-Flash est conçu exactement pour le travail qu'Eigent orchestre : des boucles d'agents multimodaux à long horizon, économiques, qui s'exécutent de bout en bout plutôt que de répondre à une seule invite. Eigent est une application de bureau « Cowork » open source et locale qui transforme des modèles comme ceux-ci en une équipe multi-agents — de la révision de PR GitHub à l'exécution d'un agent de codage IA auto-hébergé que vous possédez entièrement. Apportez votre propre modèle, gardez le travail sur votre machine. Téléchargez Eigent et construisez vos propres flux de travail d'agents dès aujourd'hui.
Recent Posts

Cursor Origin : La Forge Git Conçue pour les Agents IA, Expliquée
Cursor Origin est une forge git pour l'ère agentique. Découvrez ce qui a été livré en bêta anticipée, comment fonctionne la mise en miroir GitHub, ce que les agents peuvent faire, et ce qui manque encore aujourd'hui.

Slack Code : Les agents IA de codage passent en mode multijoueur
Slack Code place les agents IA de codage dans des canaux partagés pour que les équipes planifient, révisent et livrent ensemble. Voici comment fonctionnent les canaux de code, à qui ils s'adressent et quels sont les compromis.

GLM-5.3 : le modèle de codage de Z.ai qui a développé une compétence cybersécurité inattendue
GLM-5.3 expliqué : comment le modèle open-weight de Z.ai surpasse GLM-5.2 sur le codage à long horizon, pourquoi sa capacité cyber a surpris l'équipe, et quand les poids seront disponibles.