Toolathlon-GYM: 도구 사용 에이전트를 위한 대규모 장기호흡 환경
로컬 PostgreSQL 데이터베이스로 구동되는 503개의 멀티툴 작업 — 외부 API 불필요

실제 도구 사용에 대해 LLM 에이전트를 학습하고 평가하는 일은 어렵습니다. 기존 데이터셋의 대부분은 도구 범위가 너무 좁거나, 규모가 너무 작거나, 시간이 지나며 변하는 실시간 외부 API에 의존합니다. 우리는 503개의 작업, 25개의 MCP 서버, 그리고 풍부한 모의 데이터베이스를 갖춘 대규모 독립형 환경인 Toolathlon-GYM을 소개합니다. 이 환경은 완전히 로컬에서 실행되며, 평가 시 외부 API 호출이 전혀 필요하지 않습니다.
Toolathlon-GYM은 HKUST-NLP의 Toolathlon 인프라를 기반으로 확장되었습니다. 작업 형식, 평가 프레임워크, MCP 서버 인터페이스, 데이터베이스 스키마 설계는 모두 Toolathlon 프로젝트에서 비롯되었습니다. 이 데이터셋은 동일한 형식을 더 큰 규모에 적용하여, 학습과 평가를 위한 훨씬 더 크고 다양한 작업 풀을 제공합니다. 각 작업은 에이전트가 모의 기업 데이터베이스에서 데이터를 가져오고, 스프레드시트 보고서를 생성하고, 캘린더 이벤트를 예약하고, 요약 이메일을 보내는 등의 엔드투엔드 목표를 고정된 MCP(Model Context Protocol) 서버 집합을 도구로 사용해 완료하도록 요구합니다.
모든 작업은 완전 자동화되어 있습니다. preprocess/main.py 스크립트가 실행 전에 초기 작업 공간 상태를 설정하고, 에이전트는 제공된 도구를 사용해 작업을 수행하며, evaluation/main.py 스크립트가 출력물을 기준 정답과 대조해 확인합니다. 사람 평가자나 실시간 외부 서비스는 개입하지 않습니다.
이 데이터셋은 실제로 중요한 에이전트 역량을 스트레스 테스트하도록 설계되었습니다: 이기종 도구 전반의 다단계 계획, 구조화된 파일 형식의 읽기와 쓰기, 시스템 간 데이터 동기화, 그리고 고정된 단계 예산 내에서의 장기호흡 작업 완료입니다. 또한 CAMEL-AI 프레임워크로 구축된 예시 에이전트를 제공하여 Toolathlon-GYM 환경에서 실행할 수 있도록 했습니다.
작업 구조
503개 작업은 모두 tasks/finalpool/에 있습니다. 각 작업 디렉터리는 일관된 구조를 따릅니다:
<task-name>/
├── task_config.json # 에이전트가 사용할 수 있는 MCP 서버
├── docs/
│ ├── task.md # 에이전트에게 표시되는 작업 설명
│ └── agent_system_prompt.md
├── evaluation/main.py # 자동 평가기
├── preprocess/main.py # DB 상태 설정(각 작업 전 자동 실행)
├── initial_workspace/ # 에이전트 작업 공간에 사전 로드되는 입력 파일
└── groundtruth_workspace/ # 평가용 기준 출력
작업 설명(task.md)은 도구나 서비스 브랜드명을 쓰지 않고 작성됩니다. 즉, "Notion", "Google Calendar", "Canvas" 같은 도구명은 "지식 베이스", "공유 캘린더", "학습관리시스템" 같은 일반적인 설명으로 숨겨집니다. 이는 원래 Toolathlon 프로젝트에서 사용한 동일한 난독화 관례이며, 에이전트가 키워드 인식에 기반한 지름길을 택하지 못하게 하여 진정한 도구 사용 추론을 유도합니다.
모의 데이터베이스
연결: toolathlon_gym @ localhost:5432 (user: eigent, password: camel)
모든 데이터는 압축된 덤프(db/init.sql.gz, 8.2 MB)에서 초기화된 로컬 PostgreSQL 데이터베이스에서 제공됩니다. 런타임에는 외부 API 호출이 발생하지 않습니다. 따라서 환경을 완전히 제어할 수 있고, API 호출 제한, 스키마 변경, 데이터 드리프트 문제를 피할 수 있습니다.
데이터는 실제 소스에서 가져오거나 이를 모사해 생성되었습니다: 학습관리시스템 데이터에는 Kaggle OULAD(Open University Learning Analytics Dataset), 기업 HR 데이터에는 Kaggle HR Analytics, 금융 데이터에는 Yahoo Finance API, 전자상거래 데이터에는 Kaggle Amazon product datasets와 DummyJSON의 조합이 사용되었습니다.
데이터가 풍부한 스키마
| MCP Database | 설명 | 규모 |
|---|---|---|
| canvas | 학습관리시스템 — 강좌, 사용자, 수강 등록, 과제, 제출물, 퀴즈, 루브릭, 공지 | 22 courses, 28,865 users, 32,663 enrollments, 206 assignments, 173,912 submissions, 77 quizzes |
| snowflake | 기업 데이터 웨어하우스 — HR 분석, 영업, 지원센터 도메인 | 50,000 employees, 20,000 sales orders, 31,588 support tickets |
| woocommerce | 전자상거래 — 상품, 주문, 고객, 쿠폰, 리뷰, 배송 구역, 세율 | 82 products, 150 orders, 50 customers, 396 reviews |
| yahoo_finance | 주식 시장 — 가격, 재무제표, 뉴스, 옵션, 보유자 | 50 tickers, 3,510 price records |
| youtube | 동영상 플랫폼 — 채널, 재생목록, 동영상, 전사본 | 3 channels, 2 playlists, 135 videos |
| train | 철도 시스템 — 역, 열차, 노선, 좌석 | 8 trains, 16 routes |
데이터셋 통계
총계: 503 tasks
MCP 수 분포
작업은 4개에서 8개의 MCP 서버를 사용하며, 대부분은 4–7개 도구를 필요로 합니다. MCP 수가 높을수록 시스템 간 조정이 더 많이 필요하다는 뜻입니다. 에이전트는 하나의 작업 안에서 더 이질적인 도구들을 조율하고, 더 긴 행동 시퀀스를 계획하며, 서비스 간 더 복잡한 데이터 흐름을 처리해야 합니다:
| 작업당 MCP 수 | 작업 수 |
|---|---|
| 4 | 123 |
| 5 | 133 |
| 6 | 105 |
| 7 | 126 |
| 8 | 16 |
아래는 각 구간의 대표 예시로, MCP 수에 따라 작업 복잡도와 조정 요구사항이 어떻게 확장되는지 보여줍니다. (원문이 너무 길기 때문에 여기에는 작업의 요약만 표시됩니다.)
4 MCPs — wc-customer-retention-email (woocommerce, excel, emails, filesystem)
온라인 스토어에서 총 지출액 기준 상위 10명의 고객을 식별하세요. Rank, Name, Email, Orders_Count, Total_Spent 열을 포함한
VIP_Customer_Report.xlsx엑셀 스프레드시트를 만들고, 총 지출액이 높은 순으로 정렬하세요. 그런 다음vip-program@store.example.com에서 이 10명의 고객 각각에게 이름을 불러 개인화된 감사 이메일을 보내고, 총 지출액을 언급하세요.
5 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word (rail_12306, notion, google_calendar, word, emails)
베이징과 상하이 사이의 당일 왕복 여행을 계획하세요. 2026년 3월 10일 양방향의 이용 가능한 고속열차를 조회하고, 시간대를 기준으로 가장 적합한 출발편과 귀환편을 선택하세요. 팀 지식 베이스에 여행 세부 정보를 기록하고, 세 개 섹션(Outbound Journey, Return Journey, Booking Summary)으로 구성된
Travel_Plan.docx를 만들고, 여행 시간대를 포함하는 캘린더 이벤트 2개를 추가한 뒤,travel@consulting.com으로 확인 이메일을 보내세요.
6 MCPs — arxiv-conference-prep (scholarly, arxiv-latex, pptx, google_calendar, emails, filesystem)
RLHF Summit 2026 컨퍼런스 준비를 하세요. 인간 피드백을 통한 강화학습에 관한 논문을 최소 5편 검색한 뒤, 각 논문의 전체 LaTeX 소스를 읽어 방법론 세부 사항을 추출하세요. 제목 슬라이드, RLHF 분야 개요, 논문별 슬라이드 1장씩, 종합 슬라이드로 구성된 PowerPoint 프레젠테이션을 만드세요. 2026년 4월 10일 컨퍼런스용 캘린더 이벤트를 추가하고, 준비 자료를 협업자들에게 이메일로 보내세요.
7 MCPs — arxiv-research-pipeline-notion-excel (scholarly, arxiv_local, terminal, excel, notion, filesystem)
대규모 언어 모델에 대한 연구 지식 베이스를 구축하세요. LLM, 프롬프트 엔지니어링, in-context learning 관련 논문을 검색하세요. 터미널을 사용해 논문 메타데이터와 내용을 읽고, 관련성 점수를 계산하고, 구조화된 JSON 요약을 출력하는 종합 스크립트를 실행하세요. Paper_Catalog, Method_Comparison, Research_Gaps의 세 시트를 포함한 Excel 파일을 만들고, 연구 대시보드, 분야 개요, 방법론 비교, 식별된 공백을 담은 "LLM Research Hub"라는 제목의 Notion 페이지를 만드세요.
8 MCPs — arxiv-research-workflow-pipeline (scholarly, arxiv-latex, terminal, word, google_calendar, emails, pdf-tools, filesystem)
최근 신경망 아키텍처 관련 논문을 검색하고 PDF를 다운로드하는 것으로 시작하는 문헌 검토 파이프라인을 구축하세요. 이 논문들의 LaTeX 소스 파일을 구문 분석해 핵심 수학적 정식을 추출하고 구조화된 형식으로 정리하세요. 수집한 자료를 바탕으로 적절한 학술 인용이 포함된 분류된 참고문헌을 만드세요. 그런 다음 주요 동향을 종합하고, 연구 공백을 식별하며, 향후 가능 방향을 개괄하는 2,000단어 분량의 연구 요약문을 작성하세요. 마지막으로 팀 검토 회의를 예약하고, 요약 문서를 첨부한 캘린더 초대장을 보내고, 협업과 향후 참조를 위해 모든 작업 파일을 중앙 저장 위치에 보관하세요.
MCP 서버 커버리지
이 데이터셋 전반에 걸쳐 25개의 MCP 서버가 사용되며, 파일 입출력, 데이터 웨어하우스, 생산성 도구, 웹 상호작용, 도메인별 API를 아우릅니다. 아래 표는 각 서버를 포함하는 작업 수를 보여 주어, 어떤 도구 범주가 환경에서 가장 많이 활용되는지 파악할 수 있게 합니다:

가장 자주 사용되는 서버는 작업의 출력 중심적 특성을 반영합니다. filesystem은 에이전트의 작업 공간으로서 거의 모든 작업에 등장하며, 입력 파일을 읽고 결과를 쓰는 데 사용됩니다. excel과 emails는 가장 흔한 두 가지 출력 채널로, 대부분의 작업은 최소 하나의 구조화된 스프레드시트와 요약 메시지를 생성합니다. terminal은 다른 도구만으로는 처리할 수 없는 데이터 변환이나 통계 분석을 위해, 에이전트가 코드 스크립트를 작성하고 실행해야 함을 의미합니다.
snowflake는 기업 워크플로 작업의 주요 데이터 소스이며, HR 분석(50,000명의 직원, 급여, 성과 평가, 근속 데이터), 영업(지역과 고객 세그먼트 전반의 20,000개 주문), 고객 지원(31,588개의 티켓과 SLA 및 해결 메타데이터)이라는 세 가지 도메인을 제공합니다. 작업은 일반적으로 하나 또는 두 개의 도메인을 조회하고, 집계를 계산하거나 이상치를 표시한 뒤, 결과를 Excel이나 Word에 기록합니다. canvas도 비슷하게 LMS 작업의 기반이 되며, 에이전트는 22개 강좌와 173,912개 제출물로 구성된 데이터셋에서 과제 제출물을 강좌별로 필터링하고, 성적 분포를 계산하거나, 성적 위험 학생을 표시합니다.
playwright_with_chunk와 fetch는 모두 모의 로컬 서버에서 데이터를 가져옵니다. playwright 작업은 HTML 페이지(예: 경쟁사 프로필이나 상품 목록)를 스크래핑하고, fetch 작업은 REST API 엔드포인트(예: 산업 급여 데이터셋이나 재고 예측)를 호출한 뒤, 그 결과를 데이터 웨어하우스 기록과 결합합니다. google_forms 작업은 한 단계 더 나아가, 에이전트가 구조화된 설문을 프로그램matically 생성한 다음, 주문 또는 등록 데이터를 조회해 적절한 수신자를 식별하고 개인화된 초대장을 보냅니다.
howtocook은 케이터링, 식단 계획, 영양 분석 작업에 사용되는 레시피 및 영양 데이터베이스를 제공합니다. pdf-tools는 입력으로 제공되는 참조 PDF를 읽는 용도와, 출력으로 형식화된 보고서를 생성하는 용도 모두로 등장합니다. memory는 에이전트가 반복 사이의 검색 진행 상황을 추적하고 이미 가져온 데이터를 다시 조회하지 않아야 하는 다중 라운드 연구 작업을 가능하게 합니다. youtube-transcript는 동영상 녹화에서 원시 전사 텍스트를 추출하고, 에이전트는 이를 처리해 구조화된 문서나 설문을 생성합니다.
초기 작업 공간 파일 유형
작업 시작 시 에이전트에게 제공되는 초기 작업 공간 파일 유형은 11가지의 서로 다른 형식에 걸쳐 있으며, 에이전트가 실제 기업 워크플로에서 마주칠 문서 범위를 포괄합니다. 분포는 현실적인 작업 구성을 반영합니다. Markdown 브리프와 PDF 참조 문서가 가장 흔하고, 그다음으로 JSON과 Excel 같은 구조화된 데이터 형식이 오며, 에이전트는 이를 읽고 변환한 뒤 다시 작성해야 합니다:

초기 작업 공간에서 가장 대표적으로 발견되는 파일 유형은 다음과 같습니다:
Markdown (.md) 파일은 가장 흔한 입력으로, 작업 브리프, 운영 가이드, 계획 템플릿 역할을 합니다. 예: 철도 예약 작업의 회사 출장 정책인 travel_guide.md, 영업 분석의 통계 접근법인 analysis_methodology.md, 또는 문헌 검토의 주제 범위인 Research_Scope.md.
PDF (.pdf) 파일은 에이전트가 행동하기 전에 반드시 파싱해야 하는 참조 문서입니다. 보상 정책, 포트폴리오 가이드라인, 평가 루브릭, 감사 절차처럼 내용이 올바른 출력을 직접 결정합니다. JSON (.json) 파일은 trip settings, 필터 임계값, 감사 기준, 예산 상한, 팀 명단 같은 매개변수화된 설정을 담아, 작업 설명을 바꾸지 않고도 작업을 다양화할 수 있게 합니다.
Excel (.xlsx) 입력은 에이전트가 채워 넣어야 할 미리 정의된 열 머리글이 있는 템플릿입니다(예: paper_notes_template.xlsx, approved_budget.xlsx). CSV (.csv) 파일은 데이터베이스 결과와 조인할 표 형식 참조 데이터를 담습니다. 예: 산업 급여 데이터셋, 포트폴리오 보유 종목, 교수진 디렉터리, 공급업체 연락처 목록. Text (.txt) 파일은 논문 ID 다운로드 목록, 이메일 본문 템플릿, 분기별 매출 목표, 에스컬레이션 정책 규칙 같은 가벼운 구조화 콘텐츠를 제공합니다.
Python (.py) 스크립트는 에이전트가 터미널을 통해 완성하고 실행하는 시작 템플릿으로, 기존 코드를 읽고 의도를 추론하며 스크립트 출력을 더 큰 워크플로에 통합하는 능력을 시험합니다. 더 드문 형식들은 각각 특정한 역할을 맡습니다. .pptx 입력은 처음부터 만드는 대신 확장해야 하는 기존 슬라이드 덱이고, .docx 입력은 채워야 할 미리 정의된 제목이 있는 문서 골격이며, 단일 .bib 파일은 새로 발견한 논문으로 보강하는 시드 참고문헌이고, 단일 .gz 아카이브는 내용을 사용하기 전에 터미널로 압축을 풀어야 합니다.
Toolathlon-GYM이 다른 점
규모와 다양성
25개의 MCP 서버와 6개의 데이터 도메인에 걸친 503개 작업으로, Toolathlon-GYM은 이 분야의 이전 데이터셋보다 훨씬 더 크고 도구 다양성도 높습니다. 작업은 단일 도구 조회가 아니라 진정한 시스템 간 조정을 요구하도록 설계되었습니다.
완전히 로컬이며 재현 가능
전체 환경은 하나의 Docker Compose 파일로 실행됩니다. 평가 시 데이터 서비스용 API 키가 필요하지 않습니다. PostgreSQL 덤프는 버전 관리되며 결정적이므로, 결과는 기기와 시간에 관계없이 재현 가능합니다.
현실적인 작업 복잡도
작업은 실제 기업 워크플로 패턴에서 비롯되었습니다. 예를 들어 HR 데이터베이스에서 데이터를 가져와 급여 분석 스프레드시트를 만들고, 학습관리시스템 제출 기록을 캘린더 마감일과 대조하고, 스크래핑한 웹 데이터로 슬라이드 덱을 생성하는 등 여러 단계를 거치는 목표가 포함됩니다. 대부분의 작업은 올바르게 완료하려면 4–7개의 도구가 필요합니다.
감사의 말
Toolathlon-GYM은 다음의 인프라와 원본 데이터 파이프라인을 기반으로 구축되었습니다:
Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon
모의 데이터베이스 스키마 설계, MCP 서버 인터페이스, 작업 평가 프레임워크는 Toolathlon 프로젝트에서 비롯되었습니다. 이 데이터셋은 여기에 추가 작업과 더 큰 규모의 모의 데이터를 더해 확장한 것입니다.
인용
연구에 Toolathlon-GYM을 사용하신다면 다음과 같이 인용해 주세요:
@misc{toolathlon-gym,
author = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
title = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
year = {2026},
url = {https://github.com/eigent-ai/toolathlon_gym}
}
문의
연락을 원하시면 info@eigent.ai로 문의해 주세요
Recent Posts

Qwen3.8-Max: Alibaba의 2.4T 오픈 웨이트 코딩 모델
Qwen3.8-Max는 코딩과 에이전트 작업을 위한 Alibaba의 2.4T 파라미터 오픈 웨이트 모델입니다. 사양, 가격, 확인된 내용과 지켜볼 점을 알아보세요.

Thinking Machines Inkling-Small: 더 큰 형제 모델을 능가하는 276B 모델
Thinking Machines Lab의 Inkling-Small은 4분의 1 크기로 Inkling에 필적하는 276B 오픈 웨이트 MoE 모델입니다. 사양, 벤치마크, 가격 및 주요 시사점을 소개합니다.

Augment Code 대안
현재 가격, 공유 사용량, 컨텍스트 품질, 소스 접근, 셀프 호스팅, 보안 및 팀 적합성을 기준으로 대규모 코드베이스용 Augment Code 대안을 비교합니다.