logo
  • Środowiska
  • Dla firm
  • Cennik
Blogs
Mar 12, 2026

Toolathlon-GYM: Środowiska wielkoskalowe o długim horyzoncie dla agentów używających narzędzi

503 zadania wielonarzędziowe wspierane przez lokalną bazę PostgreSQL — bez potrzeby korzystania z zewnętrznych API

Puzhen ZhangPuzhen Zhang
Share to
Toolathlon-GYM: Środowiska wielkoskalowe o długim horyzoncie dla agentów używających narzędzi
  • Struktura zadań
  • Mock baza danych
  • Statystyki zbioru danych
  • Co wyróżnia Toolathlon-GYM
  • Podziękowania
  • Cytowanie
  • Kontakt
Automate Everything with
AI Workforce on Desktop
Download Eigent

Trenowanie i ocenianie agentów LLM w zakresie rzeczywistego użycia narzędzi jest trudne. Większość istniejących zbiorów danych jest albo zbyt wąska pod względem pokrycia narzędzi, albo zbyt mała skalą, albo zależy od działających na żywo zewnętrznych API, które zmieniają się w czasie. Przedstawiamy Toolathlon-GYM, duże, samowystarczalne środowisko z 503 zadaniami, 25 serwerami MCP i rozbudowaną mock bazą danych. Działa w całości lokalnie, bez potrzeby wykonywania zewnętrznych wywołań API podczas ewaluacji.

Toolathlon-GYM został zbudowany na bazie infrastruktury projektu Toolathlon autorstwa HKUST-NLP i ją rozszerza. Format zadań, framework ewaluacyjny, interfejsy serwerów MCP oraz projekt schematu bazy danych pochodzą z projektu Toolathlon. Ten zbiór danych stosuje ten sam format w większej skali, tworząc znacznie większą i bardziej zróżnicowaną pulę zadań do treningu i oceny. Każde zadanie prosi agenta o realizację celu end-to-end, takiego jak pobranie danych z mock firmowej bazy danych, przygotowanie raportu w arkuszu kalkulacyjnym, zaplanowanie wydarzenia w kalendarzu i wysłanie e-maila z podsumowaniem, przy użyciu stałego zestawu serwerów MCP (Model Context Protocol) jako narzędzi.

Każde zadanie jest w pełni zautomatyzowane: skrypt preprocess/main.py przygotowuje początkowy stan workspace przed uruchomieniem, agent działa z wykorzystaniem dostarczonych narzędzi, a skrypt evaluation/main.py sprawdza wyniki względem referencyjnego ground truth. Nie biorą w tym udziału ludzie oceniający ani zewnętrzne usługi na żywo.

Zbiór danych został zaprojektowany tak, aby stres-testować możliwości agentów, które mają znaczenie w praktyce: wieloetapowe planowanie w obrębie heterogenicznych narzędzi, odczytywanie i zapisywanie ustrukturyzowanych formatów plików, synchronizację danych między systemami oraz długohoryzontowe wykonywanie zadań przy stałym limicie kroków. Dostarczamy także przykładowego agenta zbudowanego w frameworku CAMEL-AI do uruchamiania w środowiskach Toolathlon-GYM.


Struktura zadań

Wszystkie 503 zadania znajdują się w tasks/finalpool/. Każdy katalog zadania ma spójną strukturę:

<task-name>/
├── task_config.json         # Których serwerów MCP może używać agent
├── docs/
│   ├── task.md              # Opis zadania widoczny dla agenta
│   └── agent_system_prompt.md
├── evaluation/main.py       # Zautomatyzowany ewaluator
├── preprocess/main.py       # Przygotowanie stanu bazy (uruchamiane automatycznie przed każdym zadaniem)
├── initial_workspace/       # Pliki wejściowe wstępnie załadowane do workspace agenta
└── groundtruth_workspace/   # Referencyjne wyniki do ewaluacji

Opisy zadań (task.md) są pisane bez nazw marek narzędzi lub usług — odniesienia do narzędzi takich jak "Notion", "Google Calendar" czy "Canvas" są maskowane ogólnymi opisami, takimi jak "baza wiedzy", "współdzielony kalendarz" lub "system zarządzania nauczaniem". Jest to ta sama konwencja maskowania używana w oryginalnym projekcie Toolathlon i zapobiega podchodzeniu przez agentów na skróty na podstawie rozpoznawania słów kluczowych, zachęcając do rzeczywistego rozumowania w użyciu narzędzi.

Mock baza danych

Połączenie: toolathlon_gym @ localhost:5432 (user: eigent, password: camel)

Wszystkie dane są obsługiwane przez lokalną bazę PostgreSQL, zainicjalizowaną z skompresowanego dumpa (db/init.sql.gz, 8.2 MB). W czasie działania nie są wykonywane żadne zewnętrzne wywołania API. Dzięki temu środowiska są w pełni kontrolowalne i unika się problemów z limitami API, zmianami schematu czy dryfem danych.

Dane pochodzą z rzeczywistych źródeł lub są na ich wzór symulowane: Kaggle OULAD (Open University Learning Analytics Dataset) dla danych Learning Management System, Kaggle HR Analytics dla korporacyjnych danych HR, Yahoo Finance API dla danych finansowych oraz kombinacja Kaggle Amazon product datasets i DummyJSON dla danych e-commerce.

Schematy bogate w dane

Baza danych MCPOpisSkala
canvasSystem zarządzania nauczaniem — kursy, użytkownicy, zapisy, zadania, oddania, quizy, rubryki, ogłoszenia22 kursy, 28,865 użytkowników, 32,663 zapisów, 206 zadań, 173,912 oddań, 77 quizów
snowflakeKorporacyjny hurtownia danych — analityka HR, sprzedaż i obszary centrum wsparcia50,000 pracowników, 20,000 zamówień sprzedażowych, 31,588 zgłoszeń do wsparcia
woocommerceE-commerce — produkty, zamówienia, klienci, kupony, opinie, strefy dostawy, stawki podatkowe82 produkty, 150 zamówień, 50 klientów, 396 opinii
yahoo_financeRynek akcji — ceny, sprawozdania finansowe, wiadomości, opcje, posiadacze50 tickerów, 3,510 rekordów cen
youtubePlatforma wideo — kanały, playlisty, filmy, transkrypcje3 kanały, 2 playlisty, 135 filmów
trainSystem kolejowy — stacje, pociągi, trasy, miejsca8 pociągów, 16 tras

Statystyki zbioru danych

Łącznie: 503 zadania

Rozkład liczby MCP

Zadania obejmują od 4 do 8 serwerów MCP, przy czym większość wymaga 4–7 narzędzi. Wyższa liczba MCP oznacza większą potrzebę koordynacji między systemami: agenci muszą orkiestrująco łączyć więcej heterogenicznych narzędzi w ramach jednego zadania, planować dłuższe sekwencje działań i obsługiwać bardziej złożone przepływy danych między usługami:

MCP na zadanieLiczba zadań
4123
5133
6105
7126
816

Poniżej znajdują się reprezentatywne przykłady z każdego poziomu, ilustrujące, jak skala złożoności zadań i wymagania koordynacyjne rosną wraz z liczbą MCP. (Ponieważ oryginalny tekst jest zbyt długi, pokazano tutaj tylko abstrakt zadania.)

4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)

Zidentyfikuj 10 najlepszych klientów sklepu internetowego według łącznej wydanej kwoty. Utwórz arkusz Excel o nazwie VIP_Customer_Report.xlsx z kolumnami Rank, Name, Email, Orders_Count i Total_Spent, posortowany od najwyższej do najniższej wartości. Następnie wyślij spersonalizowanego e-maila z podziękowaniem do każdego z tych 10 klientów z adresu vip-program@store.example.com, zwracając się do nich po imieniu i podając ich łączną kwotę wydatków.

5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)

Zaplanuj podróż w obie strony tego samego dnia między Pekinem a Szanghajem. Sprawdź dostępne pociągi dużych prędkości 10 marca 2026 w obu kierunkach i wybierz najlepsze pociągi wylotowe i powrotne na podstawie godzin. Zapisz szczegóły podróży w bazie wiedzy zespołu, utwórz Travel_Plan.docx z trzema sekcjami (Outbound Journey, Return Journey, Booking Summary), dodaj dwa wydarzenia kalendarzowe obejmujące okna podróży i wyślij e-mail z potwierdzeniem na adres travel@consulting.com.

6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)

Przygotuj się do konferencji RLHF Summit 2026. Znajdź co najmniej 5 prac o reinforcement learning from human feedback, a następnie przeczytaj ich pełny źródłowy LaTeX, aby wydobyć szczegóły metodologii. Utwórz prezentację PowerPoint ze slajdem tytułowym, przeglądem obszaru RLHF, jednym slajdem na każdą pracę oraz slajdem podsumowującym. Dodaj wydarzenie kalendarzowe dla konferencji 10 kwietnia 2026 i wyślij materiały przygotowawcze współpracownikom e-mailem.

7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)

Zbuduj bazę wiedzy badawczej o dużych modelach językowych. Szukaj publikacji o LLM-ach, prompt engineering i in-context learning. Użyj terminala do uruchomienia skryptu syntezy, który odczytuje metadane i treści prac, oblicza wyniki trafności i generuje ustrukturyzowane podsumowanie JSON. Utwórz plik Excel z trzema arkuszami (Paper_Catalog, Method_Comparison, Research_Gaps) oraz stronę Notion zatytułowaną "LLM Research Hub", zawierającą pulpit badawczy z przeglądem krajobrazu, porównaniem metodologii i zidentyfikowanymi lukami.

8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)

Zbuduj pipeline przeglądu literatury, który zaczyna się od wyszukiwania najnowszych prac o architekturach sieci neuronowych i pobierania ich plików PDF. Przeanalizuj źródłowe pliki LaTeX tych prac, aby wydobyć kluczowe sformułowania matematyczne i uporządkować je w ustrukturyzowanym formacie. Na podstawie zebranych materiałów stwórz sklasyfikowaną bibliografię z poprawnymi cytowaniami akademickimi. Następnie przygotuj 2,000-słowne podsumowanie badawcze, które syntetyzuje główne trendy, identyfikuje luki badawcze i przedstawia potencjalne kierunki przyszłych prac. Na koniec zaplanuj spotkanie zespołu do przeglądu, wyślij zaproszenia kalendarzowe z dołączonym dokumentem podsumowującym i przechowuj wszystkie pliki robocze w centralnej lokalizacji do współpracy i przyszłego wykorzystania.

Pokrycie serwerów MCP

25 serwerów MCP jest dostępnych w całym zbiorze danych, obejmując operacje wejścia/wyjścia plików, hurtownie danych, narzędzia produktywności, interakcję z siecią i specjalistyczne API domenowe. Poniższa tabela pokazuje, ile zadań obejmuje każdy serwer, dając wyobrażenie o tym, które kategorie narzędzi są najliczniej reprezentowane w środowisku:

MCP Server Task Count

Najczęściej używane serwery odzwierciedlają generujący dużo wyników charakter zadań. filesystem pojawia się niemal w każdym zadaniu jako workspace agenta do odczytu plików wejściowych i zapisywania wyników. excel i emails to dwa najczęstsze kanały wyjściowe — większość zadań generuje co najmniej jeden ustrukturyzowany arkusz kalkulacyjny i wysyła wiadomość z podsumowaniem. terminal wymaga od agenta pisania i uruchamiania skryptów kodu do transformacji danych lub analizy statystycznej, których nie da się obsłużyć wyłącznie innymi narzędziami.

snowflake jest głównym źródłem danych dla zadań z obszaru workflow przedsiębiorstw, udostępniając trzy domeny: analitykę HR (50,000 pracowników, dane o wynagrodzeniach, ocenach wydajności i stażu), sprzedaż (20,000 zamówień w regionach i segmentach klientów) oraz obsługę klienta (31,588 zgłoszeń z metadanymi SLA i rozwiązań). Zadania zwykle odpytywują jedną lub dwie domeny, obliczają agregacje lub oznaczają wartości odstające, a wyniki zapisują do Excela lub Worda. canvas podobnie stanowi podstawę zadań LMS, gdzie agenci filtrują oddania według kursu, obliczają rozkłady ocen lub oznaczają studentów zagrożonych na podstawie zbioru 22 kursów i 173,912 oddań.

playwright_with_chunk i fetch pobierają dane z mock lokalnych serwerów — zadania playwright scrapują strony HTML (np. profile konkurentów lub listy produktów), podczas gdy zadania fetch wywołują endpointy REST API (np. branżowe zbiory danych o wynagrodzeniach lub prognozy stanów magazynowych) i łączą wyniki z rekordami hurtowni danych. Zadania google_forms idą o krok dalej: agent programowo tworzy ustrukturyzowaną ankietę, a następnie odpytuje dane o zamówieniach lub zapisach, aby zidentyfikować właściwych odbiorców i wysłać spersonalizowane zaproszenia.

howtocook udostępnia bazę przepisów i danych żywieniowych używaną w zadaniach związanych z cateringiem, planowaniem posiłków i analizą żywienia. pdf-tools pojawia się zarówno jako czytnik (referencyjne pliki PDF dostarczane jako wejście), jak i jako narzędzie do tworzenia (sformatowane raporty generowane jako wynik). memory umożliwia wieloturowe zadania badawcze, w których agent musi śledzić postęp wyszukiwania między iteracjami i unikać ponownego odpytywania danych, które już pobrał. youtube-transcript wyodrębnia surowy tekst transkrypcji z nagrań wideo, który następnie agent przetwarza w celu stworzenia ustrukturyzowanych dokumentów lub ankiet.

Typy plików w początkowym workspace

Typy plików w początkowym workspace dostarczone agentowi na starcie zadania obejmują 11 odrębnych formatów, pokrywając pełne spektrum dokumentów, z jakimi agent spotkałby się w rzeczywistych procesach biznesowych. Rozkład odzwierciedla realistyczną kompozycję zadań: briefy w Markdown i dokumenty referencyjne PDF są najczęstsze, a następnie ustrukturyzowane formaty danych, takie jak JSON i Excel, które agenci muszą czytać, przekształcać i zapisywać z powrotem:

Initial Workspace File Types

Poniżej znajduje się podział najbardziej reprezentatywnych typów plików występujących w początkowym workspace:

Pliki Markdown (.md) są najczęstszym wejściem, pełniąc rolę briefów zadań, przewodników operacyjnych i szablonów planowania — np. travel_guide.md (polityka podróży firmowych dla zadania z rezerwacją kolejową), analysis_methodology.md (podejście statystyczne dla analizy sprzedaży) lub Research_Scope.md (granice tematyczne dla przeglądu literatury).

Pliki PDF (.pdf) to dokumenty referencyjne, które agent musi przeanalizować przed działaniem — polityki wynagrodzeń, wytyczne dotyczące portfela, rubryki oceniania lub procedury audytu, których treść bezpośrednio determinuje poprawny wynik. Pliki JSON (.json) zawierają sparametryzowaną konfigurację: ustawienia podróży, progi filtrowania, kryteria audytu, limity budżetowe i składy zespołów, które pozwalają różnicować zadania bez zmiany ich opisu.

Wejścia Excel (.xlsx) to wstępnie wypełnione szablony z z góry zdefiniowanymi nagłówkami kolumn, które agent ma uzupełnić (np. paper_notes_template.xlsx, approved_budget.xlsx). Pliki CSV (.csv) zawierają tabelaryczne dane referencyjne, które agent łączy z wynikami z bazy danych — branżowe dane o wynagrodzeniach, aktywach portfela, katalogach kadry lub listach kontaktowych dostawców. Pliki Text (.txt) dostarczają lekkiej, ustrukturyzowanej treści: list identyfikatorów prac do pobrania, szablonów treści e-maili, kwartalnych celów sprzedażowych lub reguł polityki eskalacji.

Skrypty Python (.py) są szablonami startowymi, które agent uzupełnia i uruchamia przez terminal, testując swoją zdolność do czytania istniejącego kodu, wywnioskowania intencji i integracji wyniku skryptu z szerszym workflow. Rzadsze formaty pełnią każdy określoną rolę: wejścia .pptx to istniejące prezentacje, które agent rozszerza, zamiast tworzyć od zera; wejścia .docx to szkielety dokumentów z predefiniowanymi nagłówkami do uzupełnienia; jedyny plik .bib to zalążek bibliografii, którą agent wzbogaca o nowo odkryte prace; a jedyny archiwum .gz musi zostać rozpakowany za pomocą terminala, zanim jego zawartość będzie mogła być użyta.

Co wyróżnia Toolathlon-GYM

Skala i różnorodność

Przy 503 zadaniach w 25 serwerach MCP i 6 domenach danych, Toolathlon-GYM jest znacznie większy i bardziej zróżnicowany narzędziowo niż wcześniejsze zbiory danych w tej przestrzeni. Zadania zostały zaprojektowane tak, aby wymagać rzeczywistej koordynacji między systemami, a nie pojedynczych wyszukiwań w jednym narzędziu.

W pełni lokalny i powtarzalny

Całe środowisko działa z jednego pliku Docker Compose. Na etapie ewaluacji nie są potrzebne żadne klucze API do usług danych. Zrzut PostgreSQL jest wersjonowany i deterministyczny, więc wyniki są powtarzalne między maszynami i w czasie.

Realistyczna złożoność zadań

Zadania pochodzą z rzeczywistych wzorców workflow przedsiębiorstw: pobierania danych z bazy HR w celu przygotowania arkusza analizy wynagrodzeń, zestawiania rekordów oddań w systemie LMS z terminami w kalendarzu, generowania prezentacji na podstawie zeskrobanego z sieci materiału i podobnych wieloetapowych celów. Większość zadań wymaga 4–7 narzędzi do poprawnego wykonania.

Podziękowania

Toolathlon-GYM opiera się na infrastrukturze i oryginalnych pipeline'ach danych z:

Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon

Projekt schematu mock bazy danych, interfejsy serwerów MCP oraz framework ewaluacyjny zadań pochodzą z projektu Toolathlon. Ten zbiór danych rozszerza oryginał o dodatkowe zadania i mock dane na większą skalę.

Cytowanie

Jeśli używasz Toolathlon-GYM w swoich badaniach, prosimy o cytowanie:

@misc{toolathlon-gym,
  author    = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
  title     = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
  year      = {2026},
  url       = {https://github.com/eigent-ai/toolathlon_gym}
}

Kontakt

Jeśli chcesz się skontaktować, napisz na info@eigent.ai

Recent Posts

Qwen3.8-Max: model Alibaba do kodowania z otwartymi wagami i 2,4 bln parametrów
Aug 4, 2026

Qwen3.8-Max: model Alibaba do kodowania z otwartymi wagami i 2,4 bln parametrów

Qwen3.8-Max to model Alibaba z otwartymi wagami i 2,4 bln parametrów do kodowania oraz pracy agentowej. Poznaj specyfikację, ceny, potwierdzone fakty i niewiadome.

EigentEigent
Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata
Aug 4, 2026

Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata

Inkling-Small od Thinking Machines Lab to model MoE 276B z otwartymi wagami, który dorównuje Inkling przy jednej czwartej rozmiaru. Specyfikacja, benchmarki, ceny i znaczenie dla branży.

EigentEigent
Alternatywa dla Augment Code
Aug 3, 2026

Alternatywa dla Augment Code

Porównaj alternatywy dla Augment Code w dużych bazach kodu pod względem aktualnych cen, wspólnego użycia, jakości kontekstu, dostępu do źródeł, samodzielnego hostingu, bezpieczeństwa i dopasowania do zespołu.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Wypróbuj Eigent już dziś

Pobierz open-source’ową aplikację desktopową. Twoja SI workforce, działająca na Twoim komputerze.

Pobierz Eigent
Eigent

Otrzymuj najnowsze aktualizacje, poradniki i wydania dotyczące automatyzacji SI workforce.

ProduktEigentŚrodowiskaCennikDla firm
OdkrywajRozwiązaniaPrzypadki użyciaUmiejętnościWtyczkiBlogi
DeweloperzyDokumentacjaGitHubCAMEL-AIFundusz Open SourcePartner
PobierzDla open source
FirmaO nasBrandKarieraWarunki korzystaniaPolityka prywatnościBezpieczeństwo i zaufaniePolityka plików cookiePolityka zwrotów i wersji próbnej

Wszelkie prawa zastrzeżone © 2026 EIGENT UK LTD

Wydano nową wersję Eigent 1.0!download