Toolathlon-GYM: Environnements à grande échelle et à long horizon pour les agents d’utilisation d’outils
503 tâches multi-outils alimentées par une base de données PostgreSQL locale — aucune API externe requise

Former et évaluer des agents LLM sur des tâches d’utilisation d’outils réelles est difficile. La plupart des jeux de données existants sont soit trop limités en couverture d’outils, soit trop petits, soit dépendent d’API externes en direct qui évoluent dans le temps. Nous introduisons Toolathlon-GYM, un environnement autonome à grande échelle avec 503 tâches, 25 serveurs MCP et une base de données fictive riche. Il fonctionne entièrement en local, sans aucun appel à une API externe au moment de l’évaluation.
Toolathlon-GYM est construit sur l’infrastructure de Toolathlon de HKUST-NLP et l’étend. Le format des tâches, le cadre d’évaluation, les interfaces des serveurs MCP et la conception du schéma de base de données proviennent tous du projet Toolathlon. Ce jeu de données applique le même format à une plus grande échelle, produisant un ensemble de tâches nettement plus vaste et plus diversifié pour l’entraînement et l’évaluation. Chaque tâche demande à un agent de mener à bien un objectif de bout en bout, comme extraire des données d’une base de données d’entreprise fictive, produire un rapport sous forme de feuille de calcul, planifier un événement dans un calendrier et envoyer un e-mail récapitulatif, en utilisant un ensemble fixe de serveurs MCP (Model Context Protocol) comme outils.
Chaque tâche est entièrement automatisée : un script preprocess/main.py prépare l’état initial de l’espace de travail avant l’exécution, l’agent agit à l’aide des outils fournis, puis un script evaluation/main.py vérifie les résultats par rapport à la vérité terrain de référence. Aucun évaluateur humain ni service externe en direct n’intervient.
Le jeu de données est conçu pour mettre à l’épreuve les capacités des agents qui comptent en pratique : planification en plusieurs étapes à travers des outils hétérogènes, lecture et écriture de formats de fichiers structurés, synchronisation de données entre systèmes, et exécution de tâches à long horizon sous une contrainte d’étapes fixe. Nous fournissons également un agent d’exemple construit avec le framework CAMEL-AI pour exécuter les environnements Toolathlon-GYM.
Structure des tâches
Les 503 tâches se trouvent toutes dans tasks/finalpool/. Chaque répertoire de tâche suit une organisation cohérente :
<task-name>/
├── task_config.json # Quels serveurs MCP l'agent peut utiliser
├── docs/
│ ├── task.md # Description de la tâche affichée à l'agent
│ └── agent_system_prompt.md
├── evaluation/main.py # Évaluateur automatisé
├── preprocess/main.py # Préparation de l'état de la base de données (exécutée automatiquement avant chaque tâche)
├── initial_workspace/ # Fichiers d'entrée préchargés dans l'espace de travail de l'agent
└── groundtruth_workspace/ # Résultats de référence pour l'évaluation
Les descriptions de tâches (task.md) sont rédigées sans noms de marques d’outils ou de services — les références à des outils comme "Notion", "Google Calendar" ou "Canvas" sont obfusquées avec des descriptions génériques telles que "base de connaissances", "calendrier partagé" ou "système de gestion de l’apprentissage". Il s’agit de la même convention d’obfuscation utilisée par le projet Toolathlon original, qui empêche les agents de prendre des raccourcis fondés sur la reconnaissance de mots-clés et encourage un raisonnement authentique autour de l’utilisation des outils.
La base de données fictive
Connexion : toolathlon_gym @ localhost:5432 (utilisateur : eigent, mot de passe : camel)
Toutes les données sont servies depuis une base de données PostgreSQL locale, initialisée à partir d’un dump compressé (db/init.sql.gz, 8.2 MB). Aucun appel à une API externe n’est effectué au moment de l’exécution. Cela rend les environnements entièrement contrôlables et évite les problèmes de limites de débit des API, de changements de schéma ou de dérive des données.
Les données sont dérivées ou simulées d’après des sources réelles : Kaggle OULAD (Open University Learning Analytics Dataset) pour les données de système de gestion de l’apprentissage, Kaggle HR Analytics pour les données RH d’entreprise, Yahoo Finance API pour les données financières, ainsi qu’une combinaison de Kaggle Amazon product datasets et de DummyJSON pour les données de commerce électronique.
Schémas riches en données
| Base de données MCP | Description | Échelle |
|---|---|---|
| canvas | Système de gestion de l’apprentissage — cours, utilisateurs, inscriptions, devoirs, remises, quiz, grilles d’évaluation, annonces | 22 cours, 28,865 utilisateurs, 32,663 inscriptions, 206 devoirs, 173,912 remises, 77 quiz |
| snowflake | Entrepôt de données d’entreprise — RH analytics, ventes et centre de support | 50,000 employés, 20,000 commandes de vente, 31,588 tickets de support |
| woocommerce | E-commerce — produits, commandes, clients, coupons, avis, zones de livraison, taux de taxe | 82 produits, 150 commandes, 50 clients, 396 avis |
| yahoo_finance | Marché boursier — prix, états financiers, actualités, options, détenteurs | 50 tickers, 3,510 enregistrements de prix |
| youtube | Plateforme vidéo — chaînes, playlists, vidéos, transcriptions | 3 chaînes, 2 playlists, 135 vidéos |
| train | Système ferroviaire — gares, trains, itinéraires, sièges | 8 trains, 16 itinéraires |
Statistiques du jeu de données
Total : 503 tâches
Répartition du nombre de MCP
Les tâches vont de 4 à 8 serveurs MCP, la majorité nécessitant 4 à 7 outils. Un nombre de MCP plus élevé indique un besoin plus important de coordination entre systèmes : les agents doivent orchestrer davantage d’outils hétérogènes au sein d’une seule tâche, planifier des séquences d’actions plus longues et gérer des flux de données plus complexes entre services :
| MCP par tâche | Nombre de tâches |
|---|---|
| 4 | 123 |
| 5 | 133 |
| 6 | 105 |
| 7 | 126 |
| 8 | 16 |
Voici des exemples représentatifs de chaque niveau, illustrant comment la complexité des tâches et les besoins de coordination augmentent avec le nombre de MCP. (Comme le texte original est trop long, seul un résumé de la tâche est présenté ici.)
4 MCP — wc-customer-retention-email (woocommerce, excel, emails, filesystem)
Identifiez les 10 meilleurs clients de la boutique en ligne selon le montant total dépensé. Créez une feuille de calcul Excel nommée
VIP_Customer_Report.xlsxavec les colonnes Rank, Name, Email, Orders_Count et Total_Spent, triées de la plus élevée à la plus faible. Envoyez ensuite un e-mail de remerciement personnalisé à chacun de ces 10 clients depuisvip-program@store.example.com, en les appelant par leur prénom et en mentionnant le montant total de leurs dépenses.
5 MCP — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)
Planifiez un aller-retour dans la même journée entre Pékin et Shanghai. Recherchez les trains à grande vitesse disponibles le 10 mars 2026 dans les deux sens et sélectionnez les meilleurs trains aller et retour en fonction des horaires. Consignez les détails du voyage dans la base de connaissances de l’équipe, créez un fichier
Travel_Plan.docxavec trois sections (Outbound Journey, Return Journey, Booking Summary), ajoutez deux événements de calendrier couvrant les plages de voyage, puis envoyez un e-mail de confirmation àtravel@consulting.com.
6 MCP — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)
Préparez la conférence RLHF Summit 2026. Recherchez au moins 5 articles sur le reinforcement learning from human feedback, puis lisez leur source LaTeX complète pour en extraire les détails méthodologiques. Créez une présentation PowerPoint avec une diapositive de titre, un aperçu du domaine RLHF, une diapositive par article et une diapositive de synthèse. Ajoutez un événement de calendrier pour la conférence le 10 avril 2026 et envoyez les documents de préparation aux collaborateurs par e-mail.
7 MCP — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)
Créez une base de connaissances de recherche sur les grands modèles de langage. Recherchez des articles sur les LLM, le prompt engineering et le in-context learning. Utilisez le terminal pour exécuter un script de synthèse qui lit les métadonnées et le contenu des articles, calcule des scores de pertinence et produit un résumé JSON structuré. Créez un fichier Excel avec trois feuilles (Paper_Catalog, Method_Comparison, Research_Gaps) et une page Notion intitulée "LLM Research Hub" contenant un tableau de bord de recherche avec vue d’ensemble du paysage, comparaison des méthodologies et lacunes identifiées.
8 MCP — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)
Mettez en place un pipeline de revue de littérature qui commence par la recherche d’articles récents sur les architectures de réseaux neuronaux et le téléchargement de leurs PDF. Analysez les fichiers source LaTeX de ces articles pour extraire les formulations mathématiques clés et organisez-les dans un format structuré. À partir des matériaux collectés, construisez une bibliographie catégorisée avec des citations académiques appropriées. Produisez ensuite un résumé de recherche de 2 000 mots qui synthétise les grandes tendances, identifie les lacunes de recherche et décrit les orientations futures potentielles. Enfin, planifiez une réunion de revue d’équipe, envoyez des invitations de calendrier avec le document de synthèse en pièce jointe, et stockez tous les fichiers de travail dans un emplacement centralisé pour la collaboration et les consultations futures.
Couverture des serveurs MCP
25 serveurs MCP sont disponibles dans l’ensemble du jeu de données, couvrant l’entrée/sortie de fichiers, les entrepôts de données, les outils de productivité, l’interaction web et des API spécifiques à certains domaines. Le tableau ci-dessous montre combien de tâches incluent chaque serveur, donnant une idée des catégories d’outils les plus représentées dans l’environnement :

Les serveurs les plus fréquemment utilisés reflètent la nature orientée sortie des tâches. filesystem apparaît dans presque chaque tâche comme espace de travail de l’agent pour lire les fichiers d’entrée et écrire les résultats. excel et emails sont les deux canaux de sortie les plus courants — la plupart des tâches produisent au moins une feuille de calcul structurée et envoient un message récapitulatif. terminal exige de l’agent qu’il écrive et exécute des scripts de code pour la transformation de données ou l’analyse statistique que les autres outils ne peuvent pas prendre en charge seuls.
snowflake est la principale source de données pour les tâches de workflow d’entreprise, exposant trois domaines : RH analytics (50,000 employés, données de salaire, de performance et d’ancienneté), ventes (20,000 commandes à travers les régions et les segments clients) et support client (31,588 tickets avec métadonnées SLA et de résolution). Les tâches interrogent généralement un ou deux domaines, calculent des agrégations ou signalent des valeurs aberrantes, puis écrivent les résultats dans Excel ou Word. canvas sert de même de socle aux tâches LMS, avec des agents qui filtrent les remises par cours, calculent des distributions de notes ou signalent des étudiants à risque à partir d’un jeu de données de 22 cours et 173,912 remises.
playwright_with_chunk et fetch récupèrent tous deux des données depuis des serveurs locaux fictifs — les tâches playwright extraient des pages HTML (par ex. des profils de concurrents ou des listes de produits), tandis que les tâches fetch appellent des points de terminaison d’API REST (par ex. des jeux de données sur les salaires du secteur ou des prévisions de stock) et combinent les résultats avec les enregistrements de l’entrepôt de données. Les tâches google_forms vont encore plus loin : l’agent crée un questionnaire structuré de manière programmatique, puis interroge les données de commandes ou d’inscriptions pour identifier les bons destinataires et envoie des invitations personnalisées.
howtocook expose une base de données de recettes et de nutrition utilisée pour des tâches de restauration, de planification de repas et d’analyse nutritionnelle. pdf-tools apparaît à la fois comme lecteur (PDF de référence fournis en entrée) et comme rédacteur (rapports mis en forme générés en sortie). memory permet des tâches de recherche en plusieurs tours où l’agent doit suivre la progression des recherches au fil des itérations et éviter de redemander des données déjà récupérées. youtube-transcript extrait le texte brut des transcriptions vidéo, que l’agent traite ensuite pour produire des documents structurés ou des enquêtes.
Types de fichiers de l’espace de travail initial
Les types de fichiers fournis à l’agent dans l’espace de travail initial au démarrage d’une tâche couvrent 11 formats distincts, représentant toute la gamme de documents qu’un agent rencontrerait dans de vrais workflows d’entreprise. La distribution reflète une composition réaliste des tâches : les briefs en Markdown et les documents de référence PDF sont les plus courants, suivis de formats de données structurées comme JSON et Excel que les agents doivent lire, transformer et réécrire :

Voici une répartition des types de fichiers les plus représentatifs présents dans l’espace de travail initial :
Les fichiers Markdown (.md) sont l’entrée la plus courante, servant de briefs de tâche, de guides opérationnels et de modèles de planification — par ex. travel_guide.md (politique de voyage de l’entreprise pour une tâche de réservation ferroviaire), analysis_methodology.md (approche statistique pour une analyse des ventes) ou Research_Scope.md (périmètre du sujet pour une revue de littérature).
Les fichiers PDF (.pdf) sont des documents de référence que l’agent doit analyser avant d’agir — politiques de rémunération, directives de portefeuille, grilles d’évaluation ou procédures d’audit dont le contenu détermine directement la bonne sortie. Les fichiers JSON (.json) contiennent une configuration paramétrée : paramètres de voyage, seuils de filtrage, critères d’audit, plafonds budgétaires et listes d’équipes, ce qui permet de faire varier les tâches sans modifier leur description.
Les entrées Excel (.xlsx) sont des modèles préremplis avec des en-têtes de colonnes prédéfinis que l’agent doit renseigner (par ex. paper_notes_template.xlsx, approved_budget.xlsx). Les fichiers CSV (.csv) contiennent des données de référence tabulaires que l’agent croise avec les résultats de la base de données — jeux de données de salaires sectoriels, participations de portefeuille, annuaires de professeurs ou listes de contacts de fournisseurs. Les fichiers Text (.txt) fournissent du contenu structuré léger : listes d’identifiants d’articles à télécharger, modèles de corps d’e-mails, objectifs trimestriels de ventes ou règles de politique d’escalade.
Les scripts Python (.py) sont des modèles de départ que l’agent complète et exécute via le terminal, testant sa capacité à lire du code existant, à en déduire l’intention et à intégrer la sortie du script dans un workflow plus vaste. Les formats plus rares remplissent chacun un rôle spécifique : les entrées .pptx sont des présentations existantes que l’agent étend plutôt que de créer de zéro ; les entrées .docx sont des structures de document avec des titres prédéfinis à compléter ; le seul fichier .bib est une bibliographie de départ que l’agent enrichit avec de nouveaux articles découverts ; et la seule archive .gz doit être décompressée avec le terminal avant que son contenu puisse être utilisé.
Ce qui distingue Toolathlon-GYM
Échelle et diversité
Avec 503 tâches réparties sur 25 serveurs MCP et 6 domaines de données, Toolathlon-GYM est nettement plus vaste et plus diversifié en outils que les jeux de données antérieurs dans ce domaine. Les tâches sont conçues pour exiger une véritable coordination entre systèmes plutôt qu’un simple recours à un seul outil.
Entièrement local et reproductible
L’ensemble de l’environnement fonctionne à partir d’un seul fichier Docker Compose. Aucune clé API pour les services de données n’est nécessaire au moment de l’évaluation. Le dump PostgreSQL est versionné et déterministe, de sorte que les résultats sont reproductibles d’une machine à l’autre et au fil du temps.
Complexité réaliste des tâches
Les tâches sont inspirées de modèles de workflow d’entreprise réels : extraire des données d’une base RH pour produire un tableau d’analyse des salaires, croiser des enregistrements de système de gestion de l’apprentissage avec des échéances de calendrier, générer des diapositives à partir de données web collectées, et d’autres objectifs multi-étapes similaires. La plupart des tâches nécessitent 4 à 7 outils pour être correctement menées à bien.
Remerciements
Toolathlon-GYM s’appuie sur l’infrastructure et les pipelines de données originaux de :
Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon
La conception du schéma de la base de données fictive, les interfaces des serveurs MCP et le cadre d’évaluation des tâches proviennent du projet Toolathlon. Ce jeu de données étend l’original avec des tâches supplémentaires et des données fictives à plus grande échelle.
Citation
Si vous utilisez Toolathlon-GYM dans vos recherches, veuillez citer :
@misc{toolathlon-gym,
author = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
title = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
year = {2026},
url = {https://github.com/eigent-ai/toolathlon_gym}
}
Contact
Si vous souhaitez nous contacter, veuillez écrire à info@eigent.ai
Recent Posts

Claude Opus 5 : Intelligence quasi-frontière à moitié prix
Claude Opus 5 offre une intelligence proche de Fable 5 à moitié prix, avec un curseur d'effort pour échanger de la puissance de calcul contre des économies. Spécifications, tarifs et impact sur les agents.

Alternative à Cursor (Gratuite & Open Source) : L'Espace de Travail Qui Vous Appartient
Vous cherchez une alternative gratuite et open source à Cursor après l'acquisition par SpaceX ? Comparez les coûts, l'auto-hébergement, le choix du modèle et la résidence des données, avec un chemin de migration.

Claude Record a Skill : Apprenez à Claude vos workflows par enregistrement d'écran
La fonctionnalité Record a skill de Claude transforme un enregistrement d'écran en compétence réutilisable. Découvrez son fonctionnement, les accès selon les plans, les étapes de configuration et ses limites.