Toolathlon-GYM: Großskalige Langzeitumgebungen für Tool-Use-Agenten
503 Multi-Tool-Aufgaben, unterstützt von einer lokalen PostgreSQL-Datenbank — keine externen APIs erforderlich

Das Trainieren und Evaluieren von LLM-Agenten auf realitätsnaher Tool-Nutzung ist schwierig. Die meisten bestehenden Datensätze sind entweder zu eng im Tool-Umfang, zu klein in der Größe oder hängen von Live-External-APIs ab, die sich im Laufe der Zeit ändern. Wir stellen Toolathlon-GYM vor, eine großskalige, eigenständige Umgebung mit 503 Aufgaben, 25 MCP-Servern und einer umfangreichen Mock-Datenbank. Sie läuft vollständig lokal, ohne dass zur Evaluierungszeit externe API-Aufrufe erforderlich sind.
Toolathlon-GYM basiert auf der Infrastruktur von Toolathlon von HKUST-NLP und erweitert sie. Das Aufgabenformat, das Evaluierungsframework, die MCP-Server-Schnittstellen und das Datenbankschema stammen alle aus dem Toolathlon-Projekt. Dieser Datensatz wendet dasselbe Format in größerem Maßstab an und erzeugt dadurch einen deutlich größeren und vielfältigeren Aufgabenpool für Training und Evaluation. Jede Aufgabe verlangt von einem Agenten, ein End-to-End-Ziel zu erfüllen, etwa Daten aus einer Mock-Unternehmensdatenbank abzurufen, einen Tabellenbericht zu erstellen, einen Kalendereintrag zu planen und eine Zusammenfassungs-E-Mail zu senden, wobei ein festgelegter Satz von MCP-(Model Context Protocol)-Servern als Tools verwendet wird.
Jede Aufgabe ist vollständig automatisiert: Ein preprocess/main.py-Script richtet vor dem Lauf den anfänglichen Workspace-Zustand ein, der Agent arbeitet mit den bereitgestellten Tools, und ein evaluation/main.py-Script prüft die Ausgaben anhand der Referenz-Groundtruth. Es sind weder menschliche Gutachter noch Live-External-Services beteiligt.
Der Datensatz ist dafür ausgelegt, Agentenfähigkeiten unter realen Bedingungen zu testen: mehrstufige Planung über heterogene Tools hinweg, Lesen und Schreiben strukturierter Dateiformate, systemübergreifende Datensynchronisation und die erfolgreiche Bewältigung langfristiger Aufgaben innerhalb eines festen Schrittbudgets. Außerdem stellen wir einen Beispiel-Agenten bereit, der mit dem CAMEL-AI-Framework für den Einsatz in den Toolathlon-GYM-Umgebungen gebaut wurde.
Aufgabenstruktur
Alle 503 Aufgaben liegen in tasks/finalpool/. Jeder Aufgabenordner folgt einem einheitlichen Aufbau:
<task-name>/
├── task_config.json # Welche MCP-Server der Agent verwenden kann
├── docs/
│ ├── task.md # Aufgabenbeschreibung, die dem Agenten angezeigt wird
│ └── agent_system_prompt.md
├── evaluation/main.py # Automatischer Evaluator
├── preprocess/main.py # DB-Zustands-Setup (wird vor jeder Aufgabe automatisch ausgeführt)
├── initial_workspace/ # Eingabedateien, die vorab in den Agenten-Workspace geladen werden
└── groundtruth_workspace/ # Referenzausgaben für die Bewertung
Die Aufgabenbeschreibungen (task.md) werden ohne Tool- oder Service-Markennamen verfasst — Verweise auf Tools wie "Notion", "Google Calendar" oder "Canvas" werden durch generische Beschreibungen wie "Wissensdatenbank", "gemeinsamer Kalender" oder "Learning Management System" verschleiert. Dies ist dieselbe Verschleierungs-Konvention, die auch im ursprünglichen Toolathlon-Projekt verwendet wird, und verhindert, dass Agenten Abkürzungen über Stichworterkennung nehmen, wodurch echtes Tool-Use-Reasoning gefördert wird.
Die Mock-Datenbank
Verbindung: toolathlon_gym @ localhost:5432 (user: eigent, password: camel)
Alle Daten werden aus einer lokalen PostgreSQL-Datenbank bereitgestellt, die aus einem komprimierten Dump initialisiert wird (db/init.sql.gz, 8.2 MB). Zur Laufzeit werden keine externen API-Aufrufe gemacht. Dadurch sind die Umgebungen vollständig kontrollierbar und Probleme durch API-Ratenlimits, Schemaänderungen oder Daten-Drift werden vermieden.
Die Daten stammen aus realen Quellen oder sind nach ihnen simuliert: Kaggle OULAD (Open University Learning Analytics Dataset) für Learning-Management-System-Daten, Kaggle HR Analytics für Unternehmens-HR-Daten, Yahoo Finance API für Finanzdaten sowie eine Kombination aus Kaggle Amazon product datasets und DummyJSON für E-Commerce-Daten.
Datenreiche Schemata
| MCP-Datenbank | Beschreibung | Umfang |
|---|---|---|
| canvas | Learning Management System — Kurse, Benutzer, Einschreibungen, Aufgaben, Abgaben, Quizze, Rubriken, Ankündigungen | 22 Kurse, 28,865 Benutzer, 32,663 Einschreibungen, 206 Aufgaben, 173,912 Abgaben, 77 Quizze |
| snowflake | Enterprise Data Warehouse — HR-Analytics-, Vertriebs- und Support-Center-Domänen | 50,000 Mitarbeiter, 20,000 Verkaufsaufträge, 31,588 Support-Tickets |
| woocommerce | E-Commerce — Produkte, Bestellungen, Kunden, Gutscheine, Bewertungen, Versandzonen, Steuersätze | 82 Produkte, 150 Bestellungen, 50 Kunden, 396 Bewertungen |
| yahoo_finance | Aktienmarkt — Kurse, Finanzberichte, Nachrichten, Optionen, Halter | 50 Ticker, 3,510 Kursdatensätze |
| youtube | Videoplattform — Kanäle, Playlists, Videos, Transkripte | 3 Kanäle, 2 Playlists, 135 Videos |
| train | Bahnsystem — Bahnhöfe, Züge, Strecken, Sitzplätze | 8 Züge, 16 Strecken |
Datensatzstatistiken
Gesamt: 503 Aufgaben
Verteilung der MCP-Anzahl
Die Aufgaben reichen von 4 bis 8 MCP-Servern, wobei die Mehrheit 4–7 Tools erfordert. Eine höhere MCP-Anzahl bedeutet eine stärkere systemübergreifende Koordination: Agenten müssen innerhalb einer einzigen Aufgabe mehr heterogene Tools orchestrieren, längere Aktionssequenzen planen und komplexere Datenflüsse über mehrere Dienste hinweg handhaben:
| MCPs pro Aufgabe | Anzahl der Aufgaben |
|---|---|
| 4 | 123 |
| 5 | 133 |
| 6 | 105 |
| 7 | 126 |
| 8 | 16 |
Nachfolgend sind repräsentative Beispiele aus jeder Stufe aufgeführt, die veranschaulichen, wie Aufgabenkomplexität und Koordinationsanforderungen mit der MCP-Anzahl skalieren. (Da der ursprüngliche Text zu lang ist, wird hier nur eine Zusammenfassung der Aufgabe angezeigt.)
4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)
Identifizieren Sie die Top 10 Kunden des Online-Shops nach insgesamt ausgegebenem Betrag. Erstellen Sie eine Excel-Tabelle namens
VIP_Customer_Report.xlsxmit den Spalten Rank, Name, Email, Orders_Count und Total_Spent, sortiert von hoch nach niedrig. Senden Sie dann jedem dieser 10 Kunden vonvip-program@store.example.comeine personalisierte Dankes-E-Mail, sprechen Sie sie mit dem Vornamen an und erwähnen Sie ihren gesamten Ausgabenbetrag.
5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)
Planen Sie eine Hin- und Rückreise am selben Tag zwischen Beijing und Shanghai. Prüfen Sie verfügbare Hochgeschwindigkeitszüge am 10. März 2026 in beide Richtungen und wählen Sie den besten Hin- und Rückzug anhand der Zeiten aus. Erfassen Sie die Reisedetails in der Team-Wissensdatenbank, erstellen Sie eine
Travel_Plan.docxmit drei Abschnitten (Outbound Journey, Return Journey, Booking Summary), fügen Sie zwei Kalendereinträge für die Reisezeiträume hinzu und senden Sie eine Bestätigungs-E-Mail antravel@consulting.com.
6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)
Bereiten Sie sich auf die Konferenz RLHF Summit 2026 vor. Suchen Sie nach mindestens 5 Arbeiten über Reinforcement Learning from Human Feedback und lesen Sie dann deren vollständigen LaTeX-Quellcode, um Methodendetails zu extrahieren. Erstellen Sie eine PowerPoint-Präsentation mit einer Titelfolie, einem Überblick über das RLHF-Feld, einer Folie pro Paper und einer Synthesefolie. Fügen Sie einen Kalendereintrag für die Konferenz am 10. April 2026 hinzu und senden Sie Vorbereitungsmaterialien per E-Mail an Mitarbeitende.
7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)
Erstellen Sie eine Wissensdatenbank für Forschung zu Large Language Models. Suchen Sie nach Arbeiten zu LLMs, Prompt Engineering und In-Context Learning. Verwenden Sie das Terminal, um ein Synthesescript auszuführen, das Paper-Metadaten und Inhalte einliest, Relevanzwerte berechnet und eine strukturierte JSON-Zusammenfassung ausgibt. Erstellen Sie eine Excel-Datei mit drei Tabellenblättern (Paper_Catalog, Method_Comparison, Research_Gaps) und eine Notion-Seite mit dem Titel "LLM Research Hub", die ein Research-Dashboard mit Landschaftsübersicht, Methodenvergleich und identifizierten Lücken enthält.
8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)
Richten Sie eine Literaturrecherche-Pipeline ein, die damit beginnt, aktuelle Arbeiten zu neuronalen Netzwerkarchitekturen zu suchen und deren PDFs herunterzuladen. Parsen Sie die LaTeX-Quelldateien dieser Arbeiten, um zentrale mathematische Formulierungen zu extrahieren und sie in einem strukturierten Format zu organisieren. Erstellen Sie auf Basis der gesammelten Materialien eine kategorisierte Bibliografie mit korrekten akademischen Zitaten. Erstellen Sie dann eine 2,000 Wörter umfassende Forschungszusammenfassung, die zentrale Trends synthetisiert, Forschungslücken identifiziert und mögliche zukünftige Richtungen skizziert. Planen Sie abschließend ein Team-Review-Meeting, senden Sie Kalendereinladungen mit dem angehängten Zusammenfassungsdokument und speichern Sie alle Arbeitsdateien an einem zentralen Ort für die Zusammenarbeit und spätere Referenz.
MCP-Server-Abdeckung
25 MCP-Server sind über den gesamten Datensatz hinweg verfügbar und decken Datei-Ein- und -Ausgabe, Data Warehouses, Produktivitätstools, Web-Interaktionen und domänenspezifische APIs ab. Die folgende Tabelle zeigt, wie viele Aufgaben jeden Server einschließen, und vermittelt so einen Eindruck davon, welche Tool-Kategorien in der Umgebung am stärksten vertreten sind:

Die am häufigsten verwendeten Server spiegeln den output-lastigen Charakter der Aufgaben wider. filesystem erscheint in nahezu jeder Aufgabe als Workspace des Agenten zum Lesen von Eingabedateien und Schreiben von Ergebnissen. excel und emails sind die beiden häufigsten Ausgabekanäle — die meisten Aufgaben erzeugen mindestens eine strukturierte Tabelle und senden eine Zusammenfassung. terminal erfordert vom Agenten, Code-Skripte für Datentransformation oder statistische Analysen zu schreiben und auszuführen, die nicht allein von anderen Tools verarbeitet werden können.
snowflake ist die primäre Datenquelle für Enterprise-Workflow-Aufgaben und stellt drei Domänen bereit: HR-Analytics (50,000 Mitarbeiter, Gehälter, Leistungsbewertungen und Betriebszugehörigkeitsdaten), Vertrieb (20,000 Bestellungen über Regionen und Kundensegmente hinweg) und Kundensupport (31,588 Tickets mit SLA- und Lösungs-Metadaten). Aufgaben fragen typischerweise eine oder zwei Domänen ab, berechnen Aggregationen oder markieren Ausreißer und schreiben Ergebnisse in Excel oder Word. canvas bildet ähnlich die Grundlage für LMS-Aufgaben, bei denen Agenten Einreichungen nach Kurs filtern, Notenverteilungen berechnen oder gefährdete Studierende aus einem Datensatz mit 22 Kursen und 173,912 Einreichungen identifizieren.
playwright_with_chunk und fetch rufen beide Daten von lokalen Mock-Servern ab — Playwright-Aufgaben scrapen HTML-Seiten (z. B. Wettbewerberprofile oder Produktlisten), während fetch-Aufgaben REST-API-Endpunkte aufrufen (z. B. Branchen-Gehaltsdatensätze oder Bestandsprognosen) und die Ergebnisse mit Data-Warehouse-Datensätzen verknüpfen. google_forms-Aufgaben gehen noch einen Schritt weiter: Der Agent erstellt programmgesteuert eine strukturierte Umfrage, fragt dann Bestell- oder Einschreibungsdaten ab, um die richtigen Empfänger zu identifizieren, und sendet personalisierte Einladungen.
howtocook stellt eine Rezept- und Ernährungsdatenbank bereit, die für Catering-, Essensplanungs- und Ernährungsanalyse-Aufgaben verwendet wird. pdf-tools erscheint sowohl als Reader (Referenz-PDFs werden als Eingabe bereitgestellt) als auch als Writer (formatierte Berichte werden als Ausgabe erzeugt). memory ermöglicht mehrstufige Rechercheaufgaben, bei denen der Agent den Suchfortschritt über mehrere Iterationen hinweg verfolgen und erneute Abfragen bereits abgerufener Daten vermeiden muss. youtube-transcript extrahiert Roh-Transkripttext aus Videoaufzeichnungen, den der Agent anschließend verarbeitet, um strukturierte Dokumente oder Umfragen zu erstellen.
Dateitypen im Initial Workspace
Die Datei-Typen im Initial Workspace, die dem Agenten zu Beginn einer Aufgabe bereitgestellt werden, umfassen 11 verschiedene Formate und decken das gesamte Spektrum von Dokumenten ab, denen ein Agent in realen Unternehmens-Workflows begegnen würde. Die Verteilung spiegelt eine realistische Aufgabenkomposition wider: Markdown-Briefings und PDF-Referenzdokumente sind am häufigsten, gefolgt von strukturierten Datenformaten wie JSON und Excel, die Agenten lesen, transformieren und wieder zurückschreiben müssen:

Hier ist eine Aufschlüsselung der repräsentativsten Datei-Typen, die im Initial Workspace zu finden sind:
Markdown (.md)-Dateien sind die häufigste Eingabe und dienen als Aufgabenbriefings, operative Leitfäden und Planungsvorlagen — z. B. travel_guide.md (Firmenreise-Richtlinie für eine Bahn-Buchungsaufgabe), analysis_methodology.md (statistischer Ansatz für eine Vertriebsanalyse) oder Research_Scope.md (Themenabgrenzung für eine Literaturrecherche).
PDF (.pdf)-Dateien sind Referenzdokumente, die der Agent vor dem Handeln parsen muss — Vergütungsrichtlinien, Portfolio-Leitlinien, Bewertungsschemata oder Prüfverfahren, deren Inhalt unmittelbar das korrekte Ergebnis bestimmt. JSON (.json)-Dateien enthalten parametrisierte Konfigurationen: Reiseeinstellungen, Filtergrenzen, Prüfkriterien, Budgetobergrenzen und Teamlisten, mit denen Aufgaben variiert werden können, ohne die Aufgabenbeschreibung zu ändern.
Excel (.xlsx)-Eingaben sind vorausgefüllte Vorlagen mit vordefinierten Spaltenüberschriften, die der Agent ausfüllen muss (z. B. paper_notes_template.xlsx, approved_budget.xlsx). CSV (.csv)-Dateien enthalten tabellarische Referenzdaten, die der Agent mit Datenbankergebnissen verknüpft — Branchen-Gehaltsdatensätze, Portfoliobestände, Fakultätsverzeichnisse oder Lieferantenkontaktlisten. Text (.txt)-Dateien liefern leichtgewichtige strukturierte Inhalte: Listen von Paper-IDs zum Herunterladen, Vorlagen für E-Mail-Texte, vierteljährliche Vertriebsziele oder Eskalationsrichtlinien.
Python (.py)-Skripte sind Startervorlagen, die der Agent über das Terminal vervollständigt und ausführt, wodurch seine Fähigkeit getestet wird, bestehenden Code zu lesen, die Absicht zu erschließen und Skriptausgaben in einen größeren Workflow zu integrieren. Die selteneren Formate erfüllen jeweils eine spezifische Rolle: .pptx-Eingaben sind vorhandene Foliensätze, die der Agent erweitert statt von Grund auf neu erstellt; .docx-Eingaben sind Dokumentengerüste mit vordefinierten Überschriften, die befüllt werden; die einzelne .bib-Datei ist eine Seed-Bibliografie, die der Agent mit neu entdeckten Arbeiten erweitert; und das einzelne .gz-Archiv muss vor der Nutzung seines Inhalts mit dem Terminal entpackt werden.
Was Toolathlon-GYM unterscheidet
Umfang und Vielfalt
Mit 503 Aufgaben über 25 MCP-Server und 6 Datendomänen hinweg ist Toolathlon-GYM deutlich größer und tool-vielfältiger als frühere Datensätze in diesem Bereich. Die Aufgaben sind so konzipiert, dass sie echte systemübergreifende Koordination erfordern statt nur Abfragen mit einem einzelnen Tool.
Vollständig lokal und reproduzierbar
Die gesamte Umgebung läuft aus einer einzigen Docker-Compose-Datei. Zur Evaluierungszeit werden keine API-Keys für Datendienste benötigt. Der PostgreSQL-Dump ist versioniert und deterministisch, sodass die Ergebnisse über Maschinen hinweg und im Zeitverlauf reproduzierbar sind.
Realistische Aufgabenkomplexität
Die Aufgaben orientieren sich an realen Enterprise-Workflow-Mustern: Daten aus einer HR-Datenbank abrufen, um eine Gehaltsanalyse-Tabelle zu erstellen, LMS-Abgabetermine mit Kalenderfristen abgleichen, Foliensätze aus gescrapten Webdaten generieren und ähnliche mehrstufige Ziele. Die meisten Aufgaben erfordern 4–7 Tools, um korrekt gelöst zu werden.
Danksagungen
Toolathlon-GYM basiert auf der Infrastruktur und den ursprünglichen Datenpipelines von:
Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon
Das Schema-Design der Mock-Datenbank, die MCP-Server-Schnittstellen und das Aufgaben-Evaluierungsframework stammen aus dem Toolathlon-Projekt. Dieser Datensatz erweitert das Original um zusätzliche Aufgaben und Mock-Daten in größerem Maßstab.
Zitation
Wenn Sie Toolathlon-GYM in Ihrer Forschung verwenden, zitieren Sie bitte:
@misc{toolathlon-gym,
author = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
title = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
year = {2026},
url = {https://github.com/eigent-ai/toolathlon_gym}
}
Kontakt
Wenn Sie Kontakt aufnehmen möchten, wenden Sie sich bitte an info@eigent.ai
Recent Posts

Qwen3.8-Max: Alibabas 2,4T-Open-Weight-Modell für Coding
Qwen3.8-Max ist Alibabas Open-Weight-Modell mit 2,4T Parametern für Coding und agentische Arbeit. Hier finden Sie Spezifikationen, Preise, bestätigte Fakten und offene Fragen.

Thinking Machines Inkling-Small: Ein 276B-Modell, das seinen größeren Bruder übertrifft
Thinking Machines Labs Inkling-Small ist ein 276B Open-Weights-MoE, das Inkling bei einem Viertel der Größe entspricht. Spezifikationen, Benchmarks, Preise und warum das wichtig ist.

Alternative zu Augment Code
Vergleichen Sie Augment-Code-Alternativen für große Codebasen nach aktuellen Preisen, gemeinsamer Nutzung, Kontextqualität, Quellzugriff, Self-Hosting, Sicherheit und Teameignung.