Toolathlon-GYM: Entornos de larga duración a gran escala para agentes de uso de herramientas
503 tareas multi-herramienta respaldadas por una base de datos PostgreSQL local — no se requieren APIs externas

Entrenar y evaluar agentes LLM en el uso de herramientas del mundo real es difícil. La mayoría de los conjuntos de datos existentes son demasiado limitados en cobertura de herramientas, demasiado pequeños en escala o dependen de APIs externas en vivo que cambian con el tiempo. Presentamos Toolathlon-GYM, un entorno a gran escala y autónomo con 503 tareas, 25 servidores MCP y una rica base de datos simulada. Funciona completamente de forma local, sin necesidad de llamadas a APIs externas durante la evaluación.
Toolathlon-GYM se construye sobre y amplía la infraestructura de Toolathlon de HKUST-NLP. El formato de las tareas, el marco de evaluación, las interfaces de los servidores MCP y el diseño del esquema de la base de datos provienen todos del proyecto Toolathlon. Este conjunto de datos aplica el mismo formato a mayor escala, generando un conjunto de tareas mucho más grande y diverso para entrenamiento y evaluación. Cada tarea pide a un agente que complete un objetivo de extremo a extremo, como extraer datos de una base de datos empresarial simulada, producir un informe en hoja de cálculo, programar un evento de calendario y enviar un correo electrónico de resumen, utilizando un conjunto fijo de servidores MCP (Model Context Protocol) como herramientas.
Cada tarea está completamente automatizada: un script preprocess/main.py configura el estado inicial del espacio de trabajo antes de la ejecución, el agente actúa utilizando las herramientas proporcionadas y un script evaluation/main.py comprueba los resultados frente al groundtruth de referencia. No intervienen evaluadores humanos ni servicios externos en vivo.
El conjunto de datos está diseñado para poner a prueba capacidades de los agentes que importan en la práctica: planificación de varios pasos en herramientas heterogéneas, lectura y escritura de formatos de archivo estructurados, sincronización de datos entre sistemas y finalización de tareas de larga duración bajo un presupuesto fijo de pasos. También proporcionamos un agente de ejemplo creado con el framework CAMEL-AI para ejecutar en los entornos de Toolathlon-GYM.
Estructura de las tareas
Las 503 tareas residen en tasks/finalpool/. Cada directorio de tarea sigue una estructura coherente:
<task-name>/
├── task_config.json # Qué servidores MCP puede usar el agente
├── docs/
│ ├── task.md # Descripción de la tarea mostrada al agente
│ └── agent_system_prompt.md
├── evaluation/main.py # Evaluador automatizado
├── preprocess/main.py # Configuración del estado de la BD (se ejecuta automáticamente antes de cada tarea)
├── initial_workspace/ # Archivos de entrada precargados en el espacio de trabajo del agente
└── groundtruth_workspace/ # Resultados de referencia para la evaluación
Las descripciones de las tareas (task.md) se escriben sin nombres de marca de herramientas o servicios: las referencias a herramientas como "Notion", "Google Calendar" o "Canvas" se ocultan con descripciones genéricas como "base de conocimiento", "calendario compartido" o "sistema de gestión del aprendizaje". Esta es la misma convención de ofuscación usada por el proyecto Toolathlon original, y evita que los agentes tomen atajos basados en el reconocimiento de palabras clave, fomentando un razonamiento genuino sobre el uso de herramientas.
La base de datos simulada
Conexión: toolathlon_gym @ localhost:5432 (usuario: eigent, contraseña: camel)
Todos los datos se sirven desde una base de datos PostgreSQL local, inicializada a partir de un volcado comprimido (db/init.sql.gz, 8.2 MB). No se realizan llamadas a APIs externas en tiempo de ejecución. Esto hace que los entornos sean totalmente controlables y evita problemas de límites de tasa de API, cambios de esquema o deriva de datos.
Los datos se derivan o simulan a partir de fuentes del mundo real: Kaggle OULAD (Open University Learning Analytics Dataset) para datos de Learning Management System, Kaggle HR Analytics para datos empresariales de RR. HH., Yahoo Finance API para datos financieros, y una combinación de Kaggle Amazon product datasets y DummyJSON para datos de comercio electrónico.
Esquemas ricos en datos
| MCP Database | Descripción | Escala |
|---|---|---|
| canvas | Learning Management System — cursos, usuarios, matrículas, tareas, envíos, cuestionarios, rúbricas, anuncios | 22 cursos, 28,865 usuarios, 32,663 matrículas, 206 tareas, 173,912 envíos, 77 cuestionarios |
| snowflake | Almacén de datos empresarial — analítica de RR. HH., ventas y centros de soporte | 50,000 empleados, 20,000 pedidos de venta, 31,588 tickets de soporte |
| woocommerce | Comercio electrónico — productos, pedidos, clientes, cupones, reseñas, zonas de envío, tasas impositivas | 82 productos, 150 pedidos, 50 clientes, 396 reseñas |
| yahoo_finance | Mercado bursátil — precios, estados financieros, noticias, opciones, titulares | 50 tickers, 3,510 registros de precios |
| youtube | Plataforma de vídeo — canales, listas de reproducción, vídeos, transcripciones | 3 canales, 2 listas de reproducción, 135 vídeos |
| train | Sistema ferroviario — estaciones, trenes, rutas, asientos | 8 trenes, 16 rutas |
Estadísticas del conjunto de datos
Total: 503 tareas
Distribución del conteo de MCP
Las tareas van de 4 a 8 servidores MCP, y la mayoría requiere de 4 a 7 herramientas. Un mayor conteo de MCP indica que se necesita más coordinación entre sistemas: los agentes deben orquestar más herramientas heterogéneas dentro de una sola tarea, planificar secuencias de acciones más largas y manejar flujos de datos más complejos entre servicios:
| MCPs por tarea | Número de tareas |
|---|---|
| 4 | 123 |
| 5 | 133 |
| 6 | 105 |
| 7 | 126 |
| 8 | 16 |
A continuación se muestran ejemplos representativos de cada nivel, que ilustran cómo escalan la complejidad de las tareas y las exigencias de coordinación con el conteo de MCP. (Como el texto original es demasiado largo, aquí solo se muestra un resumen de la tarea.)
4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)
Identifica los 10 clientes principales de la tienda online por el importe total gastado. Crea una hoja de cálculo de Excel llamada
VIP_Customer_Report.xlsxcon las columnas Rank, Name, Email, Orders_Count y Total_Spent, ordenadas de mayor a menor. Luego envía un correo electrónico personalizado de agradecimiento a cada uno de estos 10 clientes desdevip-program@store.example.com, dirigiéndote a ellos por su nombre de pila y mencionando su importe total gastado.
5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)
Planifica un viaje de ida y vuelta en el mismo día entre Pekín y Shanghái. Consulta los trenes de alta velocidad disponibles el 10 de marzo de 2026 en ambas direcciones y selecciona los mejores trenes de ida y vuelta según los horarios. Registra los detalles del viaje en la base de conocimiento del equipo, crea un
Travel_Plan.docxcon tres secciones (Outbound Journey, Return Journey, Booking Summary), añade dos eventos de calendario que cubran las ventanas de viaje y envía un correo electrónico de confirmación atravel@consulting.com.
6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)
Prepárate para la conferencia RLHF Summit 2026. Busca al menos 5 artículos sobre reinforcement learning from human feedback y luego lee su fuente completa en LaTeX para extraer detalles de la metodología. Crea una presentación de PowerPoint con una diapositiva de título, una visión general del campo RLHF, una diapositiva por artículo y una diapositiva de síntesis. Añade un evento de calendario para la conferencia el 10 de abril de 2026 y envía los materiales de preparación a los colaboradores por correo electrónico.
7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)
Construye una base de conocimiento de investigación sobre large language models. Busca artículos sobre LLMs, prompt engineering e in-context learning. Usa el terminal para ejecutar un script de síntesis que lea los metadatos y contenidos de los artículos, calcule puntuaciones de relevancia y genere un resumen JSON estructurado. Crea un archivo de Excel con tres hojas (Paper_Catalog, Method_Comparison, Research_Gaps) y una página de Notion titulada "LLM Research Hub" que contenga un panel de investigación con una visión general del panorama, comparación de metodologías y brechas identificadas.
8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)
Establece un flujo de trabajo de revisión bibliográfica que comience buscando artículos recientes sobre neural network architectures y descargando sus PDFs. Analiza los archivos fuente LaTeX de estos artículos para extraer formulaciones matemáticas clave y organizarlas en un formato estructurado. Con base en los materiales recopilados, elabora una bibliografía categorizada con citas académicas adecuadas. Luego produce un resumen de investigación de 2,000 palabras que sintetice las principales tendencias, identifique lagunas de investigación y esboce posibles direcciones futuras. Por último, programa una reunión de revisión del equipo, envía invitaciones de calendario con el documento de resumen adjunto y guarda todos los archivos de trabajo en una ubicación centralizada para colaboración y referencia futura.
Cobertura de servidores MCP
Hay 25 servidores MCP disponibles en todo el conjunto de datos, que abarcan entrada/salida de archivos, almacenes de datos, herramientas de productividad, interacción web y APIs específicas de dominio. La tabla siguiente muestra cuántas tareas incluyen cada servidor, lo que da una idea de qué categorías de herramientas están más representadas en el entorno:

Los servidores usados con más frecuencia reflejan la naturaleza centrada en la salida de las tareas. filesystem aparece en casi todas las tareas como el espacio de trabajo del agente para leer archivos de entrada y escribir resultados. excel y emails son los dos canales de salida más comunes: la mayoría de las tareas producen al menos una hoja de cálculo estructurada y envían un mensaje de resumen. terminal requiere que el agente escriba y ejecute scripts de código para transformación de datos o análisis estadístico que no pueden manejarse solo con otras herramientas.
snowflake es la principal fuente de datos para tareas de flujo de trabajo empresarial, y expone tres dominios: analítica de RR. HH. (50,000 empleados, salarios, evaluaciones de desempeño y datos de antigüedad), ventas (20,000 pedidos en todas las regiones y segmentos de clientes) y atención al cliente (31,588 tickets con metadatos de SLA y resolución). Las tareas normalmente consultan uno o dos dominios, calculan agregaciones o detectan valores atípicos, y escriben los resultados en Excel o Word. canvas ancla de forma similar las tareas de LMS, con agentes que filtran envíos por curso, calculan distribuciones de calificaciones o señalan estudiantes en riesgo a partir de un conjunto de datos de 22 cursos y 173,912 envíos.
playwright_with_chunk y fetch recuperan datos de servidores locales simulados: las tareas de playwright extraen páginas HTML (por ejemplo, perfiles de competidores o listados de productos), mientras que las tareas de fetch llaman a endpoints REST API (por ejemplo, conjuntos de datos salariales del sector o previsiones de inventario) y combinan los resultados con registros del almacén de datos. Las tareas de google_forms van un paso más allá: el agente crea un formulario estructurado de forma programática, luego consulta datos de pedidos o matrículas para identificar a los destinatarios adecuados y envía invitaciones personalizadas.
howtocook expone una base de datos de recetas y nutrición utilizada para tareas de catering, planificación de comidas y análisis nutricional. pdf-tools aparece tanto como lector (PDFs de referencia proporcionados como entrada) como escritor (informes formateados generados como salida). memory permite tareas de investigación de varias rondas en las que el agente debe seguir el progreso de búsqueda entre iteraciones y evitar volver a consultar datos que ya ha recuperado. youtube-transcript extrae el texto bruto de transcripciones de grabaciones de vídeo, que luego el agente procesa para producir documentos o encuestas estructuradas.
Tipos de archivos del espacio de trabajo inicial
Los tipos de archivos del espacio de trabajo inicial proporcionados al agente al comenzar la tarea abarcan 11 formatos distintos, cubriendo toda la gama de documentos que un agente encontraría en flujos de trabajo empresariales reales. La distribución refleja una composición de tareas realista: los resúmenes en Markdown y los documentos PDF de referencia son los más comunes, seguidos por formatos de datos estructurados como JSON y Excel que los agentes deben leer, transformar y volver a escribir:

A continuación se muestra un desglose de los tipos de archivo más representativos que se encuentran en el espacio de trabajo inicial:
Los archivos Markdown (.md) son la entrada más común y sirven como resúmenes de tareas, guías operativas y plantillas de planificación, por ejemplo travel_guide.md (política de viajes de la empresa para una tarea de reserva ferroviaria), analysis_methodology.md (enfoque estadístico para un análisis de ventas) o Research_Scope.md (límites temáticos para una revisión bibliográfica).
Los archivos PDF (.pdf) son documentos de referencia que el agente debe analizar antes de actuar: políticas de compensación, directrices de portafolio, rúbricas de evaluación o procedimientos de auditoría cuyo contenido determina directamente el resultado correcto. Los archivos JSON (.json) contienen configuración parametrizada: ajustes de viaje, umbrales de filtro, criterios de auditoría, límites de presupuesto y listas de miembros del equipo que permiten variar las tareas sin cambiar la descripción.
Las entradas de Excel (.xlsx) son plantillas previamente rellenadas con encabezados de columna predefinidos que el agente debe completar (por ejemplo, paper_notes_template.xlsx, approved_budget.xlsx). Los archivos CSV (.csv) contienen datos de referencia tabulares que el agente cruza con los resultados de la base de datos: conjuntos de datos salariales del sector, participaciones de cartera, directorios de profesorado o listas de contactos de proveedores. Los archivos de texto (.txt) proporcionan contenido estructurado ligero: listas de IDs de artículos para descargar, plantillas para el cuerpo de correos electrónicos, objetivos trimestrales de ventas o reglas de política de escalado.
Los scripts de Python (.py) son plantillas iniciales que el agente completa y ejecuta mediante el terminal, poniendo a prueba su capacidad para leer código existente, inferir la intención e integrar la salida del script en un flujo de trabajo más amplio. Los formatos menos comunes cumplen cada uno una función específica: las entradas .pptx son presentaciones existentes que el agente amplía en lugar de crear desde cero; las entradas .docx son esqueletos de documentos con encabezados predefinidos que completar; el único archivo .bib es una bibliografía semilla que el agente amplía con artículos recién descubiertos; y el único archivo comprimido .gz debe descomprimirse con el terminal antes de poder usar su contenido.
Qué hace diferente a Toolathlon-GYM
Escala y diversidad
Con 503 tareas en 25 servidores MCP y 6 dominios de datos, Toolathlon-GYM es sustancialmente más grande y más diverso en herramientas que conjuntos de datos anteriores en este espacio. Las tareas están diseñadas para requerir una coordinación genuina entre sistemas en lugar de búsquedas en una sola herramienta.
Totalmente local y reproducible
Todo el entorno se ejecuta a partir de un único archivo Docker Compose. No se necesitan claves de API para los servicios de datos en el momento de la evaluación. El volcado de PostgreSQL está versionado y es determinista, por lo que los resultados son reproducibles entre máquinas y a lo largo del tiempo.
Complejidad realista de las tareas
Las tareas se extraen de patrones reales de flujo de trabajo empresarial: extraer datos de una base de datos de RR. HH. para producir una hoja de cálculo de análisis salarial, cruzar registros de envío de Learning Management System con fechas límite del calendario, generar presentaciones a partir de datos web extraídos, y objetivos multi-etapa similares. La mayoría de las tareas requieren de 4 a 7 herramientas para completarse correctamente.
Agradecimientos
Toolathlon-GYM se basa en la infraestructura y los canales de datos originales de:
Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon
El diseño del esquema de la base de datos simulada, las interfaces de los servidores MCP y el marco de evaluación de tareas provienen del proyecto Toolathlon. Este conjunto de datos amplía el original con tareas adicionales y datos simulados a mayor escala.
Cita
Si utilizas Toolathlon-GYM en tu investigación, cita por favor:
@misc{toolathlon-gym,
author = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
title = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
year = {2026},
url = {https://github.com/eigent-ai/toolathlon_gym}
}
Contacto
Si deseas ponerte en contacto, escribe a info@eigent.ai
Recent Posts

Alternativa a Cursor (Gratuita y de Código Abierto): El Espacio de Trabajo que Tú Controlas
¿Buscas una alternativa gratuita y de código abierto a Cursor tras la adquisición por SpaceX? Compara costes, autoalojamiento, elección de modelo y residencia de datos, además de una ruta de migración.

Claude Record a Skill: Enseña a Claude grabando tu flujo de trabajo en pantalla
La función Record a skill de Claude convierte una grabación de pantalla en una habilidad reutilizable. Aprende cómo funciona, quién tiene acceso, los pasos de configuración y sus limitaciones.

Cursor Router Explicado: Calidad de Código Frontier a Menor Costo
Cursor Router selecciona automáticamente el mejor modelo para cada solicitud de programación, manteniendo calidad frontier mientras reduce costos. Descubre cómo funciona, sus tres modos y las compensaciones.