Toolathlon-GYM: Ambientes de Longo Horizonte em Grande Escala para Agentes de Uso de Ferramentas
503 tarefas multiferamenta com suporte de um banco de dados PostgreSQL local — sem APIs externas necessárias

Treinar e avaliar agentes LLM em uso de ferramentas do mundo real é difícil. A maioria dos conjuntos de dados existentes é muito limitada na cobertura de ferramentas, pequena em escala ou depende de APIs externas ao vivo que mudam com o tempo. Apresentamos Toolathlon-GYM, um ambiente autônomo e em grande escala com 503 tarefas, 25 servidores MCP e um banco de dados mock rico. Ele funciona inteiramente localmente, sem necessidade de chamadas de API externas no momento da avaliação.
O Toolathlon-GYM foi construído com base e amplia a infraestrutura do Toolathlon da HKUST-NLP. O formato das tarefas, a estrutura de avaliação, as interfaces dos servidores MCP e o design do esquema do banco de dados têm origem no projeto Toolathlon. Este conjunto de dados aplica o mesmo formato em uma escala maior, produzindo um conjunto de tarefas substancialmente mais amplo e diverso para treinamento e avaliação. Cada tarefa pede que um agente conclua um objetivo de ponta a ponta, como extrair dados de um banco de dados corporativo mock, produzir um relatório em planilha, agendar um evento de calendário e enviar um e-mail de resumo, usando um conjunto fixo de servidores MCP (Model Context Protocol) como ferramentas.
Cada tarefa é totalmente automatizada: um script preprocess/main.py prepara o estado inicial do workspace antes da execução, o agente atua usando as ferramentas fornecidas e um script evaluation/main.py verifica as saídas em relação ao groundtruth de referência. Não há avaliadores humanos nem serviços externos ao vivo envolvidos.
O conjunto de dados foi projetado para testar ao máximo capacidades de agentes que importam na prática: planejamento em várias etapas com ferramentas heterogêneas, leitura e escrita de formatos de arquivo estruturados, sincronização de dados entre sistemas e conclusão de tarefas de longo horizonte dentro de um limite fixo de etapas. Também fornecemos um agente de exemplo construído com o framework CAMEL-AI para executar nos ambientes do Toolathlon-GYM.
Estrutura das tarefas
Todas as 503 tarefas ficam em tasks/finalpool/. Cada diretório de tarefa segue uma estrutura consistente:
<task-name>/
├── task_config.json # Quais servidores MCP o agente pode usar
├── docs/
│ ├── task.md # Descrição da tarefa mostrada ao agente
│ └── agent_system_prompt.md
├── evaluation/main.py # Avaliador automatizado
├── preprocess/main.py # Configuração do estado do DB (executado automaticamente antes de cada tarefa)
├── initial_workspace/ # Arquivos de entrada pré-carregados no workspace do agente
└── groundtruth_workspace/ # Saídas de referência para avaliação
As descrições das tarefas (task.md) são escritas sem nomes de marcas de ferramentas ou serviços — referências a ferramentas como "Notion", "Google Calendar" ou "Canvas" são obscurecidas com descrições genéricas como "base de conhecimento", "calendário compartilhado" ou "sistema de gestão de aprendizagem". Esta é a mesma convenção de obscurecimento usada pelo projeto Toolathlon original e impede que os agentes tomem atalhos com base no reconhecimento de palavras-chave, incentivando um raciocínio genuíno de uso de ferramentas.
O banco de dados mock
Conexão: toolathlon_gym @ localhost:5432 (usuário: eigent, senha: camel)
Todos os dados são servidos a partir de um banco de dados PostgreSQL local, inicializado a partir de um dump compactado (db/init.sql.gz, 8.2 MB). Nenhuma chamada de API externa é feita em tempo de execução. Isso torna os ambientes totalmente controláveis e evita problemas com limites de taxa de API, mudanças de esquema ou deriva de dados.
Os dados são derivados ou simulados a partir de fontes do mundo real: Kaggle OULAD (Open University Learning Analytics Dataset) para dados de Learning Management System, Kaggle HR Analytics para dados corporativos de RH, Yahoo Finance API para dados financeiros e uma combinação de Kaggle Amazon product datasets e DummyJSON para dados de e-commerce.
Schemas ricos em dados
| Banco de dados MCP | Descrição | Escala |
|---|---|---|
| canvas | Learning Management System — cursos, usuários, matrículas, tarefas, submissões, quizzes, rubricas, anúncios | 22 cursos, 28.865 usuários, 32.663 matrículas, 206 tarefas, 173.912 submissões, 77 quizzes |
| snowflake | Data warehouse corporativo — analytics de RH, vendas e domínio de central de suporte | 50.000 funcionários, 20.000 pedidos de venda, 31.588 tickets de suporte |
| woocommerce | E-commerce — produtos, pedidos, clientes, cupons, avaliações, zonas de envio, taxas de imposto | 82 produtos, 150 pedidos, 50 clientes, 396 avaliações |
| yahoo_finance | Mercado de ações — preços, demonstrações financeiras, notícias, opções, holders | 50 tickers, 3.510 registros de preços |
| youtube | Plataforma de vídeo — canais, playlists, vídeos, transcrições | 3 canais, 2 playlists, 135 vídeos |
| train | Sistema ferroviário — estações, trens, rotas, assentos | 8 trens, 16 rotas |
Estatísticas do conjunto de dados
Total: 503 tarefas
Distribuição da contagem de MCP
As tarefas variam de 4 a 8 servidores MCP, com a maioria exigindo 4–7 ferramentas. Uma contagem maior de MCP indica necessidade de maior coordenação entre sistemas: os agentes precisam orquestrar mais ferramentas heterogêneas dentro de uma única tarefa, planejar sequências de ações mais longas e lidar com fluxos de dados mais complexos entre serviços:
| MCPs por tarefa | Número de tarefas |
|---|---|
| 4 | 123 |
| 5 | 133 |
| 6 | 105 |
| 7 | 126 |
| 8 | 16 |
Abaixo estão exemplos representativos de cada nível, ilustrando como a complexidade da tarefa e as exigências de coordenação escalam com a contagem de MCP. (Como o texto original é muito longo, apenas um resumo da tarefa é mostrado aqui.)
4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)
Identifique os 10 principais clientes da loja online pelo valor total gasto. Crie uma planilha do Excel chamada
VIP_Customer_Report.xlsxcom as colunas Rank, Name, Email, Orders_Count e Total_Spent, ordenadas do maior para o menor. Em seguida, envie um e-mail de agradecimento personalizado para cada um desses 10 clientes a partir devip-program@store.example.com, tratando-os pelo primeiro nome e mencionando o valor total gasto por cada um.
5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)
Planeje uma viagem de ida e volta no mesmo dia entre Pequim e Xangai. Consulte os trens de alta velocidade disponíveis em 10 de março de 2026 em ambos os sentidos e selecione os melhores trens de ida e de volta com base nos horários. Registre os detalhes da viagem na base de conhecimento da equipe, crie um
Travel_Plan.docxcom três seções (Outbound Journey, Return Journey, Booking Summary), adicione dois eventos de calendário cobrindo as janelas da viagem e envie um e-mail de confirmação paratravel@consulting.com.
6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)
Prepare-se para a conferência RLHF Summit 2026. Procure pelo menos 5 artigos sobre reinforcement learning from human feedback, depois leia o código-fonte completo em LaTeX para extrair detalhes da metodologia. Crie uma apresentação em PowerPoint com um slide de título, uma visão geral da área de RLHF, um slide por artigo e um slide de síntese. Adicione um evento de calendário para a conferência em 10 de abril de 2026 e envie os materiais de preparação aos colaboradores por e-mail.
7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)
Construa uma base de conhecimento de pesquisa sobre large language models. Procure artigos sobre LLMs, prompt engineering e in-context learning. Use o terminal para executar um script de síntese que lê os metadados e conteúdos dos artigos, calcula pontuações de relevância e gera um resumo estruturado em JSON. Crie um arquivo Excel com três planilhas (Paper_Catalog, Method_Comparison, Research_Gaps) e uma página do Notion intitulada "LLM Research Hub" contendo um dashboard de pesquisa com visão geral do panorama, comparação de metodologias e lacunas identificadas.
8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)
Estabeleça um pipeline de revisão de literatura que começa buscando artigos recentes sobre arquiteturas de redes neurais e baixando seus PDFs. Faça o parsing dos arquivos-fonte em LaTeX desses artigos para extrair formulações matemáticas principais e organizá-las em um formato estruturado. Com base nos materiais coletados, monte uma bibliografia categorizada com citações acadêmicas adequadas. Em seguida, produza um resumo de pesquisa de 2.000 palavras que sintetize as principais tendências, identifique lacunas de pesquisa e descreva possíveis direções futuras. Por fim, agende uma reunião de revisão da equipe, envie convites de calendário com o documento de resumo anexado e armazene todos os arquivos de trabalho em um local केंदralizado para colaboração e referência futura.
Cobertura dos servidores MCP
25 servidores MCP estão disponíveis em todo o conjunto de dados, abrangendo entrada/saída de arquivos, data warehouses, ferramentas de produtividade, interação com a web e APIs específicas de domínio. A tabela abaixo mostra quantas tarefas incluem cada servidor, dando uma noção de quais categorias de ferramentas estão mais representadas no ambiente:

Os servidores mais usados refletem a natureza intensiva em saídas das tarefas. filesystem aparece em quase todas as tarefas como o workspace do agente para ler arquivos de entrada e escrever resultados. excel e emails são os dois canais de saída mais comuns — a maioria das tarefas produz pelo menos uma planilha estruturada e envia uma mensagem de resumo. terminal exige que o agente escreva e execute scripts de código para transformação de dados ou análise estatística que não pode ser feita apenas com outras ferramentas.
snowflake é a principal fonte de dados para tarefas de workflow corporativo, expondo três domínios: analytics de RH (50.000 funcionários, salários, avaliações de desempenho e dados de tempo de casa), vendas (20.000 pedidos em várias regiões e segmentos de clientes) e suporte ao cliente (31.588 tickets com metadados de SLA e resolução). As tarefas normalmente consultam um ou dois domínios, calculam agregações ou sinalizam outliers e gravam os resultados em Excel ou Word. canvas também sustenta tarefas de LMS, com agentes filtrando submissões por curso, calculando distribuições de notas ou sinalizando alunos em risco a partir de um conjunto de dados de 22 cursos e 173.912 submissões.
playwright_with_chunk e fetch recuperam dados de servidores locais mock — tarefas com playwright fazem scraping de páginas HTML (por exemplo, perfis de concorrentes ou listas de produtos), enquanto tarefas com fetch chamam endpoints de API REST (por exemplo, conjuntos de dados salariais do setor ou previsões de estoque) e combinam os resultados com registros do data warehouse. Tarefas google_forms vão um passo além: o agente cria programaticamente uma pesquisa estruturada, depois consulta dados de pedidos ou matrículas para identificar os destinatários certos e envia convites personalizados.
howtocook expõe um banco de dados de receitas e nutrição usado para tarefas de catering, planejamento de refeições e análise nutricional. pdf-tools aparece tanto como leitor (PDFs de referência fornecidos como entrada) quanto como escritor (relatórios formatados gerados como saída). memory possibilita tarefas de pesquisa em várias rodadas, nas quais o agente precisa acompanhar o progresso da busca entre iterações e evitar consultar novamente dados que já recuperou. youtube-transcript extrai texto bruto de transcrições de gravações de vídeo, que o agente então processa para produzir documentos estruturados ou pesquisas.
Tipos de arquivo do workspace inicial
Os tipos de arquivo do workspace inicial fornecidos ao agente no início da tarefa abrangem 11 formatos distintos, cobrindo toda a gama de documentos que um agente encontraria em fluxos de trabalho corporativos reais. A distribuição reflete uma composição realista das tarefas: briefs em Markdown e documentos de referência em PDF são os mais comuns, seguidos por formatos de dados estruturados como JSON e Excel que os agentes precisam ler, transformar e gravar de volta:

Abaixo está uma análise dos tipos de arquivo mais representativos encontrados no workspace inicial:
Arquivos Markdown (.md) são a entrada mais comum, servindo como briefs de tarefas, guias operacionais e modelos de planejamento — por exemplo, travel_guide.md (política de viagens da empresa para uma tarefa de reserva ferroviária), analysis_methodology.md (abordagem estatística para uma análise de vendas) ou Research_Scope.md (limites do tema para uma revisão de literatura).
Arquivos PDF (.pdf) são documentos de referência que o agente deve analisar antes de agir — políticas de remuneração, diretrizes de portfólio, rubricas de avaliação ou procedimentos de auditoria cujo conteúdo determina diretamente a saída correta. Arquivos JSON (.json) carregam configuração parametrizada: definições de viagem, limites de filtro, critérios de auditoria, tetos orçamentários e listas de equipe que permitem variar as tarefas sem alterar a descrição da tarefa.
Entradas Excel (.xlsx) são modelos pré-preenchidos com cabeçalhos de coluna predefinidos que o agente deve completar (por exemplo, paper_notes_template.xlsx, approved_budget.xlsx). Arquivos CSV (.csv) carregam dados tabulares de referência que o agente cruza com os resultados do banco de dados — conjuntos de dados salariais do setor, participações de portfólio, diretórios de professores ou listas de contatos de fornecedores. Arquivos de texto (.txt) fornecem conteúdo estruturado leve: listas de IDs de artigos para download, modelos de corpo de e-mail, metas trimestrais de vendas ou regras de política de escalonamento.
Scripts Python (.py) são modelos iniciais que o agente completa e executa pelo terminal, testando sua capacidade de ler código existente, inferir a intenção e integrar a saída do script em um fluxo de trabalho maior. Os formatos mais raros desempenham um papel específico: entradas .pptx são apresentações existentes que o agente amplia em vez de criar do zero; entradas .docx são esqueletos de documentos com títulos predefinidos para preencher; o único arquivo .bib é uma bibliografia semente que o agente amplia com artigos recém-descobertos; e o único arquivo .gz deve ser descompactado com o terminal antes que seu conteúdo possa ser usado.
O que torna o Toolathlon-GYM diferente
Escala e diversidade
Com 503 tarefas em 25 servidores MCP e 6 domínios de dados, o Toolathlon-GYM é substancialmente maior e mais diverso em ferramentas do que conjuntos de dados anteriores nesse espaço. As tarefas são projetadas para exigir coordenação genuína entre sistemas, e não buscas em uma única ferramenta.
Totalmente local e reproduzível
Todo o ambiente roda a partir de um único arquivo Docker Compose. Nenhuma chave de API para serviços de dados é necessária no momento da avaliação. O dump do PostgreSQL é versionado e determinístico, de modo que os resultados são reproduzíveis entre máquinas e ao longo do tempo.
Complexidade realista das tarefas
As tarefas são inspiradas em padrões reais de workflow corporativo: extrair dados de um banco de RH para produzir uma planilha de análise salarial, cruzar registros de submissão de um Learning Management System com prazos de calendário, gerar apresentações a partir de dados web extraídos e objetivos multietapas semelhantes. A maioria das tarefas exige 4–7 ferramentas para ser concluída corretamente.
Agradecimentos
O Toolathlon-GYM foi construído com base na infraestrutura e nos pipelines de dados originais de:
Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon
O design do esquema do banco de dados mock, as interfaces dos servidores MCP e a estrutura de avaliação das tarefas se originam do projeto Toolathlon. Este conjunto de dados amplia o original com tarefas adicionais e dados mock em maior escala.
Citação
Se você usar o Toolathlon-GYM em sua pesquisa, cite:
@misc{toolathlon-gym,
author = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
title = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
year = {2026},
url = {https://github.com/eigent-ai/toolathlon_gym}
}
Contato
Se você quiser entrar em contato, escreva para info@eigent.ai
Recent Posts

Alternativa ao Cursor (Gratuita e Open Source): O Workspace Que É Seu
Procurando uma alternativa gratuita e open source ao Cursor após a aquisição pela SpaceX? Compare custo, self-hosting, escolha de modelo e residência de dados, além de um caminho de migração.

Claude Record a Skill: Ensine o Claude Gravando Sua Tela de Trabalho
O recurso Record a skill do Claude transforma uma gravação de tela em uma skill reutilizável. Saiba como funciona, quem tem acesso, as etapas de configuração e suas limitações.

Cursor Router Explicado: Qualidade de Código Frontier com Menor Custo
O Cursor Router seleciona automaticamente o melhor modelo para cada requisição de codificação, mantendo qualidade frontier com menor custo. Veja como funciona, seus três modos e os trade-offs envolvidos.