Une tâche, deux modèles, le même agent
La manière la plus propre de comparer deux modèles est de ne rien changer d’autre. C’est exactement ce que nous avons fait : même tâche à long horizon, même agent, mêmes outils. Nous avons confié à GLM-5.1 et GLM-5.2 le même brief dans le cadre single-agent d’Eigent et observé comment chacun a planifié, mené la recherche, vérifié et livré.
La mission était un véritable travail d’analyste, pas un simple benchmark ludique :
Rechercher 26 entreprises de la chaîne d’infrastructure IA — depuis la conception de puces et la fabrication de semiconducteurs jusqu’aux plateformes cloud et aux centres de données qui font tourner l’IA de pointe — puis produire un rapport interactif.
Une tâche à long horizon comme celle-ci est précisément l’endroit où les modèles se différencient réellement. Ce n’est pas une seule réponse brillante ; ce sont des dizaines de petites décisions enchaînées sur une longue durée : à quel point planifier en profondeur, combien de sources faire confiance, quand arrêter la recherche, et jusqu’où vérifier avant de déclarer la tâche terminée.
Le prompt
Nous avons envoyé le même prompt aux deux exécutions, en mode single-agent :
Menez une recherche approfondie sur 26 entreprises de l'écosystème d'infrastructure IA — le fil conducteur principal le plus certain de toute la chaîne de valeur de l'IA. Couvrez les 6 sous-secteurs suivants (choisissez des entreprises représentatives dans chacun, des leaders à grande capitalisation jusqu'aux acteurs plus petits) :
- Centre de données IA (infrastructure de calcul / déploiement)
- GPU / puces IA (silicium d'entraînement et d'inférence, ASIC, IP)
- Serveurs, réseau et modules optiques (switches, NIC, interconnexions optiques)
- Alimentation, refroidissement liquide et stockage d'énergie (alimentation électrique, thermique, gestion de l'énergie)
- Cloud IA / plateforme de calcul (hyperscalers, clouds GPU, plateformes de location de calcul)
- Écosystème de soutien (HBM / packaging avancé, fonderie, connecteurs et autres composants critiques)
Pour chaque entreprise, recherchez : nom de l'entreprise, sous-secteur, siège / pays ; produits principaux et rôle spécifique dans la chaîne IA ; public ou privé (ticker + bourse si coté ; si privé, indiquer la dernière valorisation / levée de fonds) ; capitalisation boursière ou taille de la valorisation (utilisée pour le classement) ; positionnement et avantage concurrentiel dans l'écosystème (1 à 2 phrases) ; principaux clients / concurrents.
Classez les entreprises au sein de chaque sous-secteur du plus grand au plus petit, et structurez l'ensemble de manière descendante : du paysage global de l’écosystème matériel jusqu’à chaque entreprise individuelle.
Sortie : générez d’abord un fichier structuré ai_infra_data.json avec les 26 entreprises, les 6 classifications de sous-secteurs, un indicateur public/privé et une matrice de comparaison croisée. Générez ensuite un rapport HTML soigné et interactif à partir de ce JSON — diagramme du paysage de l’écosystème, sections par secteur, cartes d’entreprises, code couleur public vs privé, graphique de classement par capitalisation boursière et tableau de comparaison triable/filtrable. Vérifiez d’abord l’exactitude des données de recherche (statut de cotation, tickers, valorisations — dernières données, sources citées), puis générez le rapport.
Préparer l’exécution — GLM-5.2 planifie plus en profondeur
La première divergence est apparue avant même que l’un ou l’autre modèle ne touche au Web : dans le plan.
GLM-5.1 a découpé le travail en 4 étapes. GLM-5.2 a élargi le même brief en 6 étapes — et, de manière révélatrice, a fait de « vérifier l’exactitude » une tâche dédiée plutôt qu’un simple point de passage. C’est ainsi qu’un analyste rigoureux cadre la mission : rechercher, puis prouver la recherche, puis construire.
Mêmes instructions. Jugement différent sur le niveau de rigueur que mérite la tâche.
La recherche — deux fois plus de sources
Les plans se sont transformés en sessions de recherche très différentes.
- GLM-5.1 : ~40 sources
- GLM-5.2 : ~82 sources — soit environ 2× plus de recherches
Et il ne s’agissait pas seulement de plus de pages — elles étaient mieux réparties. Là où GLM-5.1 s’appuyait fortement sur un seul site de données, GLM-5.2 a recoupé chaque chiffre à travers des médias financiers, des documents d’entreprise et des bases de données de marché privé : Reuters, Bloomberg, Crunchbase, TechCrunch, et d’autres.
Une seule source ne suffit pas. Pour les valorisations, les tickers et le statut de cotation, GLM-5.2 a traité chaque chiffre comme une hypothèse à confirmer — pas comme un fait à copier.
GLM-5.2 n’a pas seulement répondu plus vite. Il a creusé plus profondément, en s’appuyant sur deux fois plus de pages pour vérifier chaque chiffre.
Vérifier avant de terminer
Parce que GLM-5.2 avait isolé la vérification dans une étape à part, il l’a réellement faite — en revérifiant le statut de cotation, les tickers et les valorisations à partir des chiffres les plus récents avant de les intégrer au rapport. Le résultat est un rapport qui démontre son travail au lieu de l’affirmer.
Le résultat — des données plus riches, de vraies citations
Même tâche. Deux livrables très différents.
GLM-5.2 a produit :
- Un schéma de données plus riche avec une analyse du moat, des détails de financement et une liste complète des sources — chaque affirmation étant traçable jusqu’à son origine.
- Un rapport final presque 2× plus riche que celui de GLM-5.1, à la fois en données et en structure.
- Une sortie livrée sous forme de site interactif entièrement déployable — pas seulement une page HTML statique : diagramme du paysage de l’écosystème, sections par secteur, code couleur public vs privé, graphique de classement par capitalisation boursière et tableau de comparaison triable/filtrable.
GLM-5.1 a livré un rapport solide et correct. GLM-5.2 a livré un document que vous pourriez présenter à un comité d’investissement.
Pourquoi c’est important
Sur une tâche courte, deux modèles capables se ressemblent à peu près. Sur une tâche à long horizon, les écarts se cumulent. Chaque source supplémentaire que GLM-5.2 a choisi de lire, chaque chiffre qu’il a choisi de revérifier, et la décision de faire de la vérification une étape de premier ordre se sont additionnés pour produire un résultat nettement meilleur.
Le cadre était identique. Les outils étaient identiques. La seule variable était le modèle — et c’est précisément ce qui fait de cette comparaison une lecture équitable de la manière dont GLM-5.2 raisonne sur la durée :
Plus de sources. Un jugement plus précis. Un rapport qui prouve son travail.
Essayez par vous-même
Eigent vous permet de remplacer le modèle derrière le même cadre single-agent, afin que vous puissiez exécuter cette comparaison exacte sur votre propre tâche :
- Allez dans Settings → Models et sélectionnez ou ajoutez le modèle que vous souhaitez tester (GLM-5.1, GLM-5.2, ou tout modèle prenant en charge les function calls).
- Passez la tâche en mode single-agent.
- Collez le prompt de deep research ci-dessus (ou votre propre brief à long horizon).
- Envoyez-le une fois par modèle, puis comparez côte à côte les plans, le nombre de sources et les rapports finaux.
Ce que vous pouvez essayer ensuite
Relancez le même brief mais exigez au moins 3 sources indépendantes par valorisation, et signalez toute entreprise pour laquelle les sources divergent.
Élargissez l’univers de 26 à 50 entreprises et ajoutez une colonne « dépendance à la chaîne d’approvisionnement » à la matrice de comparaison.
Générez un résumé exécutif d’une page du rapport final en PDF, ainsi qu’un slide deck du graphique de classement par capitalisation boursière.
Faites tourner GLM-5.2 face à un autre modèle sur la même tâche et produisez un rapport diff : points d’accord, points de désaccord, et qualité de la documentation des sources.
Conseils pour de meilleurs résultats
- Rendez la vérification explicite. Demander au modèle de « vérifier l’exactitude d’abord, puis construire » change de manière mesurable son comportement — GLM-5.2 a transformé cette consigne en une étape de planification à part entière.
- Exigez des citations dans le schéma. Imposer un champ
sourcespar entreprise force une recherche traçable plutôt que des suppositions confiantes. - Séparez les données de la présentation. Générer
ai_infra_data.jsonavant le HTML rend le rapport régénérable et les faits auditables. - Utilisez le mode single-agent pour le raisonnement à long horizon. Cela garde tout le contexte de la tâche entre les mains d’un seul modèle, ce qui est exactement ce que vous voulez lorsque vous comparez la manière dont un modèle planifie et se corrige sur la durée.



