logo
  • Umgebungen
  • Enterprise
  • Preise
Blogs
Mar 12, 2026

Toolathlon-GYM: Großskalige Langzeitumgebungen für Tool-Use-Agenten

503 Multi-Tool-Aufgaben, unterstützt von einer lokalen PostgreSQL-Datenbank — keine externen APIs erforderlich

Puzhen ZhangPuzhen Zhang
Share to
Toolathlon-GYM: Großskalige Langzeitumgebungen für Tool-Use-Agenten
  • Aufgabenstruktur
  • Die Mock-Datenbank
  • Datensatzstatistiken
  • Was Toolathlon-GYM unterscheidet
  • Danksagungen
  • Zitation
  • Kontakt
Automate Everything with
AI Workforce on Desktop
Download Eigent

Das Trainieren und Evaluieren von LLM-Agenten auf realitätsnaher Tool-Nutzung ist schwierig. Die meisten bestehenden Datensätze sind entweder zu eng im Tool-Umfang, zu klein in der Größe oder hängen von Live-External-APIs ab, die sich im Laufe der Zeit ändern. Wir stellen Toolathlon-GYM vor, eine großskalige, eigenständige Umgebung mit 503 Aufgaben, 25 MCP-Servern und einer umfangreichen Mock-Datenbank. Sie läuft vollständig lokal, ohne dass zur Evaluierungszeit externe API-Aufrufe erforderlich sind.

Toolathlon-GYM basiert auf der Infrastruktur von Toolathlon von HKUST-NLP und erweitert sie. Das Aufgabenformat, das Evaluierungsframework, die MCP-Server-Schnittstellen und das Datenbankschema stammen alle aus dem Toolathlon-Projekt. Dieser Datensatz wendet dasselbe Format in größerem Maßstab an und erzeugt dadurch einen deutlich größeren und vielfältigeren Aufgabenpool für Training und Evaluation. Jede Aufgabe verlangt von einem Agenten, ein End-to-End-Ziel zu erfüllen, etwa Daten aus einer Mock-Unternehmensdatenbank abzurufen, einen Tabellenbericht zu erstellen, einen Kalendereintrag zu planen und eine Zusammenfassungs-E-Mail zu senden, wobei ein festgelegter Satz von MCP-(Model Context Protocol)-Servern als Tools verwendet wird.

Jede Aufgabe ist vollständig automatisiert: Ein preprocess/main.py-Script richtet vor dem Lauf den anfänglichen Workspace-Zustand ein, der Agent arbeitet mit den bereitgestellten Tools, und ein evaluation/main.py-Script prüft die Ausgaben anhand der Referenz-Groundtruth. Es sind weder menschliche Gutachter noch Live-External-Services beteiligt.

Der Datensatz ist dafür ausgelegt, Agentenfähigkeiten unter realen Bedingungen zu testen: mehrstufige Planung über heterogene Tools hinweg, Lesen und Schreiben strukturierter Dateiformate, systemübergreifende Datensynchronisation und die erfolgreiche Bewältigung langfristiger Aufgaben innerhalb eines festen Schrittbudgets. Außerdem stellen wir einen Beispiel-Agenten bereit, der mit dem CAMEL-AI-Framework für den Einsatz in den Toolathlon-GYM-Umgebungen gebaut wurde.


Aufgabenstruktur

Alle 503 Aufgaben liegen in tasks/finalpool/. Jeder Aufgabenordner folgt einem einheitlichen Aufbau:

<task-name>/
├── task_config.json         # Welche MCP-Server der Agent verwenden kann
├── docs/
│   ├── task.md              # Aufgabenbeschreibung, die dem Agenten angezeigt wird
│   └── agent_system_prompt.md
├── evaluation/main.py       # Automatischer Evaluator
├── preprocess/main.py       # DB-Zustands-Setup (wird vor jeder Aufgabe automatisch ausgeführt)
├── initial_workspace/       # Eingabedateien, die vorab in den Agenten-Workspace geladen werden
└── groundtruth_workspace/   # Referenzausgaben für die Bewertung

Die Aufgabenbeschreibungen (task.md) werden ohne Tool- oder Service-Markennamen verfasst — Verweise auf Tools wie "Notion", "Google Calendar" oder "Canvas" werden durch generische Beschreibungen wie "Wissensdatenbank", "gemeinsamer Kalender" oder "Learning Management System" verschleiert. Dies ist dieselbe Verschleierungs-Konvention, die auch im ursprünglichen Toolathlon-Projekt verwendet wird, und verhindert, dass Agenten Abkürzungen über Stichworterkennung nehmen, wodurch echtes Tool-Use-Reasoning gefördert wird.

Die Mock-Datenbank

Verbindung: toolathlon_gym @ localhost:5432 (user: eigent, password: camel)

Alle Daten werden aus einer lokalen PostgreSQL-Datenbank bereitgestellt, die aus einem komprimierten Dump initialisiert wird (db/init.sql.gz, 8.2 MB). Zur Laufzeit werden keine externen API-Aufrufe gemacht. Dadurch sind die Umgebungen vollständig kontrollierbar und Probleme durch API-Ratenlimits, Schemaänderungen oder Daten-Drift werden vermieden.

Die Daten stammen aus realen Quellen oder sind nach ihnen simuliert: Kaggle OULAD (Open University Learning Analytics Dataset) für Learning-Management-System-Daten, Kaggle HR Analytics für Unternehmens-HR-Daten, Yahoo Finance API für Finanzdaten sowie eine Kombination aus Kaggle Amazon product datasets und DummyJSON für E-Commerce-Daten.

Datenreiche Schemata

MCP-DatenbankBeschreibungUmfang
canvasLearning Management System — Kurse, Benutzer, Einschreibungen, Aufgaben, Abgaben, Quizze, Rubriken, Ankündigungen22 Kurse, 28,865 Benutzer, 32,663 Einschreibungen, 206 Aufgaben, 173,912 Abgaben, 77 Quizze
snowflakeEnterprise Data Warehouse — HR-Analytics-, Vertriebs- und Support-Center-Domänen50,000 Mitarbeiter, 20,000 Verkaufsaufträge, 31,588 Support-Tickets
woocommerceE-Commerce — Produkte, Bestellungen, Kunden, Gutscheine, Bewertungen, Versandzonen, Steuersätze82 Produkte, 150 Bestellungen, 50 Kunden, 396 Bewertungen
yahoo_financeAktienmarkt — Kurse, Finanzberichte, Nachrichten, Optionen, Halter50 Ticker, 3,510 Kursdatensätze
youtubeVideoplattform — Kanäle, Playlists, Videos, Transkripte3 Kanäle, 2 Playlists, 135 Videos
trainBahnsystem — Bahnhöfe, Züge, Strecken, Sitzplätze8 Züge, 16 Strecken

Datensatzstatistiken

Gesamt: 503 Aufgaben

Verteilung der MCP-Anzahl

Die Aufgaben reichen von 4 bis 8 MCP-Servern, wobei die Mehrheit 4–7 Tools erfordert. Eine höhere MCP-Anzahl bedeutet eine stärkere systemübergreifende Koordination: Agenten müssen innerhalb einer einzigen Aufgabe mehr heterogene Tools orchestrieren, längere Aktionssequenzen planen und komplexere Datenflüsse über mehrere Dienste hinweg handhaben:

MCPs pro AufgabeAnzahl der Aufgaben
4123
5133
6105
7126
816

Nachfolgend sind repräsentative Beispiele aus jeder Stufe aufgeführt, die veranschaulichen, wie Aufgabenkomplexität und Koordinationsanforderungen mit der MCP-Anzahl skalieren. (Da der ursprüngliche Text zu lang ist, wird hier nur eine Zusammenfassung der Aufgabe angezeigt.)

4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)

Identifizieren Sie die Top 10 Kunden des Online-Shops nach insgesamt ausgegebenem Betrag. Erstellen Sie eine Excel-Tabelle namens VIP_Customer_Report.xlsx mit den Spalten Rank, Name, Email, Orders_Count und Total_Spent, sortiert von hoch nach niedrig. Senden Sie dann jedem dieser 10 Kunden von vip-program@store.example.com eine personalisierte Dankes-E-Mail, sprechen Sie sie mit dem Vornamen an und erwähnen Sie ihren gesamten Ausgabenbetrag.

5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)

Planen Sie eine Hin- und Rückreise am selben Tag zwischen Beijing und Shanghai. Prüfen Sie verfügbare Hochgeschwindigkeitszüge am 10. März 2026 in beide Richtungen und wählen Sie den besten Hin- und Rückzug anhand der Zeiten aus. Erfassen Sie die Reisedetails in der Team-Wissensdatenbank, erstellen Sie eine Travel_Plan.docx mit drei Abschnitten (Outbound Journey, Return Journey, Booking Summary), fügen Sie zwei Kalendereinträge für die Reisezeiträume hinzu und senden Sie eine Bestätigungs-E-Mail an travel@consulting.com.

6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)

Bereiten Sie sich auf die Konferenz RLHF Summit 2026 vor. Suchen Sie nach mindestens 5 Arbeiten über Reinforcement Learning from Human Feedback und lesen Sie dann deren vollständigen LaTeX-Quellcode, um Methodendetails zu extrahieren. Erstellen Sie eine PowerPoint-Präsentation mit einer Titelfolie, einem Überblick über das RLHF-Feld, einer Folie pro Paper und einer Synthesefolie. Fügen Sie einen Kalendereintrag für die Konferenz am 10. April 2026 hinzu und senden Sie Vorbereitungsmaterialien per E-Mail an Mitarbeitende.

7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)

Erstellen Sie eine Wissensdatenbank für Forschung zu Large Language Models. Suchen Sie nach Arbeiten zu LLMs, Prompt Engineering und In-Context Learning. Verwenden Sie das Terminal, um ein Synthesescript auszuführen, das Paper-Metadaten und Inhalte einliest, Relevanzwerte berechnet und eine strukturierte JSON-Zusammenfassung ausgibt. Erstellen Sie eine Excel-Datei mit drei Tabellenblättern (Paper_Catalog, Method_Comparison, Research_Gaps) und eine Notion-Seite mit dem Titel "LLM Research Hub", die ein Research-Dashboard mit Landschaftsübersicht, Methodenvergleich und identifizierten Lücken enthält.

8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)

Richten Sie eine Literaturrecherche-Pipeline ein, die damit beginnt, aktuelle Arbeiten zu neuronalen Netzwerkarchitekturen zu suchen und deren PDFs herunterzuladen. Parsen Sie die LaTeX-Quelldateien dieser Arbeiten, um zentrale mathematische Formulierungen zu extrahieren und sie in einem strukturierten Format zu organisieren. Erstellen Sie auf Basis der gesammelten Materialien eine kategorisierte Bibliografie mit korrekten akademischen Zitaten. Erstellen Sie dann eine 2,000 Wörter umfassende Forschungszusammenfassung, die zentrale Trends synthetisiert, Forschungslücken identifiziert und mögliche zukünftige Richtungen skizziert. Planen Sie abschließend ein Team-Review-Meeting, senden Sie Kalendereinladungen mit dem angehängten Zusammenfassungsdokument und speichern Sie alle Arbeitsdateien an einem zentralen Ort für die Zusammenarbeit und spätere Referenz.

MCP-Server-Abdeckung

25 MCP-Server sind über den gesamten Datensatz hinweg verfügbar und decken Datei-Ein- und -Ausgabe, Data Warehouses, Produktivitätstools, Web-Interaktionen und domänenspezifische APIs ab. Die folgende Tabelle zeigt, wie viele Aufgaben jeden Server einschließen, und vermittelt so einen Eindruck davon, welche Tool-Kategorien in der Umgebung am stärksten vertreten sind:

MCP Server Task Count

Die am häufigsten verwendeten Server spiegeln den output-lastigen Charakter der Aufgaben wider. filesystem erscheint in nahezu jeder Aufgabe als Workspace des Agenten zum Lesen von Eingabedateien und Schreiben von Ergebnissen. excel und emails sind die beiden häufigsten Ausgabekanäle — die meisten Aufgaben erzeugen mindestens eine strukturierte Tabelle und senden eine Zusammenfassung. terminal erfordert vom Agenten, Code-Skripte für Datentransformation oder statistische Analysen zu schreiben und auszuführen, die nicht allein von anderen Tools verarbeitet werden können.

snowflake ist die primäre Datenquelle für Enterprise-Workflow-Aufgaben und stellt drei Domänen bereit: HR-Analytics (50,000 Mitarbeiter, Gehälter, Leistungsbewertungen und Betriebszugehörigkeitsdaten), Vertrieb (20,000 Bestellungen über Regionen und Kundensegmente hinweg) und Kundensupport (31,588 Tickets mit SLA- und Lösungs-Metadaten). Aufgaben fragen typischerweise eine oder zwei Domänen ab, berechnen Aggregationen oder markieren Ausreißer und schreiben Ergebnisse in Excel oder Word. canvas bildet ähnlich die Grundlage für LMS-Aufgaben, bei denen Agenten Einreichungen nach Kurs filtern, Notenverteilungen berechnen oder gefährdete Studierende aus einem Datensatz mit 22 Kursen und 173,912 Einreichungen identifizieren.

playwright_with_chunk und fetch rufen beide Daten von lokalen Mock-Servern ab — Playwright-Aufgaben scrapen HTML-Seiten (z. B. Wettbewerberprofile oder Produktlisten), während fetch-Aufgaben REST-API-Endpunkte aufrufen (z. B. Branchen-Gehaltsdatensätze oder Bestandsprognosen) und die Ergebnisse mit Data-Warehouse-Datensätzen verknüpfen. google_forms-Aufgaben gehen noch einen Schritt weiter: Der Agent erstellt programmgesteuert eine strukturierte Umfrage, fragt dann Bestell- oder Einschreibungsdaten ab, um die richtigen Empfänger zu identifizieren, und sendet personalisierte Einladungen.

howtocook stellt eine Rezept- und Ernährungsdatenbank bereit, die für Catering-, Essensplanungs- und Ernährungsanalyse-Aufgaben verwendet wird. pdf-tools erscheint sowohl als Reader (Referenz-PDFs werden als Eingabe bereitgestellt) als auch als Writer (formatierte Berichte werden als Ausgabe erzeugt). memory ermöglicht mehrstufige Rechercheaufgaben, bei denen der Agent den Suchfortschritt über mehrere Iterationen hinweg verfolgen und erneute Abfragen bereits abgerufener Daten vermeiden muss. youtube-transcript extrahiert Roh-Transkripttext aus Videoaufzeichnungen, den der Agent anschließend verarbeitet, um strukturierte Dokumente oder Umfragen zu erstellen.

Dateitypen im Initial Workspace

Die Datei-Typen im Initial Workspace, die dem Agenten zu Beginn einer Aufgabe bereitgestellt werden, umfassen 11 verschiedene Formate und decken das gesamte Spektrum von Dokumenten ab, denen ein Agent in realen Unternehmens-Workflows begegnen würde. Die Verteilung spiegelt eine realistische Aufgabenkomposition wider: Markdown-Briefings und PDF-Referenzdokumente sind am häufigsten, gefolgt von strukturierten Datenformaten wie JSON und Excel, die Agenten lesen, transformieren und wieder zurückschreiben müssen:

Initial Workspace File Types

Hier ist eine Aufschlüsselung der repräsentativsten Datei-Typen, die im Initial Workspace zu finden sind:

Markdown (.md)-Dateien sind die häufigste Eingabe und dienen als Aufgabenbriefings, operative Leitfäden und Planungsvorlagen — z. B. travel_guide.md (Firmenreise-Richtlinie für eine Bahn-Buchungsaufgabe), analysis_methodology.md (statistischer Ansatz für eine Vertriebsanalyse) oder Research_Scope.md (Themenabgrenzung für eine Literaturrecherche).

PDF (.pdf)-Dateien sind Referenzdokumente, die der Agent vor dem Handeln parsen muss — Vergütungsrichtlinien, Portfolio-Leitlinien, Bewertungsschemata oder Prüfverfahren, deren Inhalt unmittelbar das korrekte Ergebnis bestimmt. JSON (.json)-Dateien enthalten parametrisierte Konfigurationen: Reiseeinstellungen, Filtergrenzen, Prüfkriterien, Budgetobergrenzen und Teamlisten, mit denen Aufgaben variiert werden können, ohne die Aufgabenbeschreibung zu ändern.

Excel (.xlsx)-Eingaben sind vorausgefüllte Vorlagen mit vordefinierten Spaltenüberschriften, die der Agent ausfüllen muss (z. B. paper_notes_template.xlsx, approved_budget.xlsx). CSV (.csv)-Dateien enthalten tabellarische Referenzdaten, die der Agent mit Datenbankergebnissen verknüpft — Branchen-Gehaltsdatensätze, Portfoliobestände, Fakultätsverzeichnisse oder Lieferantenkontaktlisten. Text (.txt)-Dateien liefern leichtgewichtige strukturierte Inhalte: Listen von Paper-IDs zum Herunterladen, Vorlagen für E-Mail-Texte, vierteljährliche Vertriebsziele oder Eskalationsrichtlinien.

Python (.py)-Skripte sind Startervorlagen, die der Agent über das Terminal vervollständigt und ausführt, wodurch seine Fähigkeit getestet wird, bestehenden Code zu lesen, die Absicht zu erschließen und Skriptausgaben in einen größeren Workflow zu integrieren. Die selteneren Formate erfüllen jeweils eine spezifische Rolle: .pptx-Eingaben sind vorhandene Foliensätze, die der Agent erweitert statt von Grund auf neu erstellt; .docx-Eingaben sind Dokumentengerüste mit vordefinierten Überschriften, die befüllt werden; die einzelne .bib-Datei ist eine Seed-Bibliografie, die der Agent mit neu entdeckten Arbeiten erweitert; und das einzelne .gz-Archiv muss vor der Nutzung seines Inhalts mit dem Terminal entpackt werden.

Was Toolathlon-GYM unterscheidet

Umfang und Vielfalt

Mit 503 Aufgaben über 25 MCP-Server und 6 Datendomänen hinweg ist Toolathlon-GYM deutlich größer und tool-vielfältiger als frühere Datensätze in diesem Bereich. Die Aufgaben sind so konzipiert, dass sie echte systemübergreifende Koordination erfordern statt nur Abfragen mit einem einzelnen Tool.

Vollständig lokal und reproduzierbar

Die gesamte Umgebung läuft aus einer einzigen Docker-Compose-Datei. Zur Evaluierungszeit werden keine API-Keys für Datendienste benötigt. Der PostgreSQL-Dump ist versioniert und deterministisch, sodass die Ergebnisse über Maschinen hinweg und im Zeitverlauf reproduzierbar sind.

Realistische Aufgabenkomplexität

Die Aufgaben orientieren sich an realen Enterprise-Workflow-Mustern: Daten aus einer HR-Datenbank abrufen, um eine Gehaltsanalyse-Tabelle zu erstellen, LMS-Abgabetermine mit Kalenderfristen abgleichen, Foliensätze aus gescrapten Webdaten generieren und ähnliche mehrstufige Ziele. Die meisten Aufgaben erfordern 4–7 Tools, um korrekt gelöst zu werden.

Danksagungen

Toolathlon-GYM basiert auf der Infrastruktur und den ursprünglichen Datenpipelines von:

Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon

Das Schema-Design der Mock-Datenbank, die MCP-Server-Schnittstellen und das Aufgaben-Evaluierungsframework stammen aus dem Toolathlon-Projekt. Dieser Datensatz erweitert das Original um zusätzliche Aufgaben und Mock-Daten in größerem Maßstab.

Zitation

Wenn Sie Toolathlon-GYM in Ihrer Forschung verwenden, zitieren Sie bitte:

@misc{toolathlon-gym,
  author    = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
  title     = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
  year      = {2026},
  url       = {https://github.com/eigent-ai/toolathlon_gym}
}

Kontakt

Wenn Sie Kontakt aufnehmen möchten, wenden Sie sich bitte an info@eigent.ai

Recent Posts

Qwen3.8-Max: Alibabas 2,4T-Open-Weight-Modell für Coding
Aug 4, 2026

Qwen3.8-Max: Alibabas 2,4T-Open-Weight-Modell für Coding

Qwen3.8-Max ist Alibabas Open-Weight-Modell mit 2,4T Parametern für Coding und agentische Arbeit. Hier finden Sie Spezifikationen, Preise, bestätigte Fakten und offene Fragen.

EigentEigent
Thinking Machines Inkling-Small: Ein 276B-Modell, das seinen größeren Bruder übertrifft
Aug 4, 2026

Thinking Machines Inkling-Small: Ein 276B-Modell, das seinen größeren Bruder übertrifft

Thinking Machines Labs Inkling-Small ist ein 276B Open-Weights-MoE, das Inkling bei einem Viertel der Größe entspricht. Spezifikationen, Benchmarks, Preise und warum das wichtig ist.

EigentEigent
Alternative zu Augment Code
Aug 3, 2026

Alternative zu Augment Code

Vergleichen Sie Augment-Code-Alternativen für große Codebasen nach aktuellen Preisen, gemeinsamer Nutzung, Kontextqualität, Quellzugriff, Self-Hosting, Sicherheit und Teameignung.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Teste Eigent noch heute

Lade die Open-Source-Desktop-App herunter. Deine KI-Belegschaft, die auf deinem Rechner läuft.

Eigent herunterladen
Eigent

Erhalte die neuesten Updates, Tutorials und Releases rund um die Automatisierung von KI-Belegschaften.

ProduktEigentUmgebungenPreiseUnternehmen
EntdeckenLösungenAnwendungsfälleFähigkeitenPluginsBlogs
EntwicklerDokuGitHubCAMEL-AIOpen Source FundPartner
HerunterladenFür Open Source
UnternehmenÜber unsMarkeKarriereNutzungsbedingungenDatenschutzerklärungSicherheit & VertrauenCookie-RichtlinieRückerstattungs- & Testrichtlinie

Alle Rechte vorbehalten © 2026 EIGENT UK LTD

Eigent 1.0 Neue Version veröffentlicht !download