logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
研究|Mar 12, 2026

Toolathlon-GYM:適用於工具使用代理的超大規模長期任務環境

503 個多工具任務,由本地 PostgreSQL 資料庫支援 — 無需外部 API

Puzhen ZhangPuzhen Zhang
Share to
Toolathlon-GYM:適用於工具使用代理的超大規模長期任務環境
  • 任務結構
  • 模擬資料庫
  • 資料集統計
  • Toolathlon-GYM 的不同之處
  • 致謝
  • 引用
  • 聯絡方式
Automate Everything with
AI Workforce on Desktop
Download Eigent

在真實世界工具使用情境下訓練與評估 LLM 代理並不容易。現有多數資料集不是工具覆蓋面太窄,就是規模太小,或是依賴會隨時間變動的即時外部 API。我們推出 Toolathlon-GYM,這是一個大規模、自包含的環境,包含 503 個任務、25 個 MCP 伺服器,以及豐富的模擬資料庫。它完全在本地執行,評估時不需要任何外部 API 呼叫。

Toolathlon-GYM 建立於 HKUST-NLP 的 Toolathlon 基礎架構之上並加以擴充。任務格式、評估框架、MCP 伺服器介面,以及資料庫 schema 設計都源自 Toolathlon 專案。本資料集沿用相同格式並擴大規模,提供更大且更多樣化的任務池,用於訓練與評估。每個任務都要求代理完成端到端目標,例如從模擬企業資料庫擷取資料、產生試算表報告、排程行事曆事件,以及傳送摘要 email,並使用一組固定的 MCP(Model Context Protocol)伺服器作為工具。

每個任務都已完整自動化:preprocess/main.py 腳本會在執行前設定初始工作區狀態,代理使用提供的工具進行操作,而 evaluation/main.py 腳本則會將輸出與參考 groundtruth 進行比對。整個流程不涉及人工評分者或即時外部服務。

本資料集旨在壓力測試實務上重要的代理能力:跨異質工具的多步驟規劃、結構化檔案格式的讀寫、跨系統資料同步,以及在固定步數預算下完成長程任務。我們也提供了一個使用 CAMEL-AI 框架建構的範例代理,可在 Toolathlon-GYM 環境中執行。


任務結構

所有 503 個任務都位於 tasks/finalpool/。每個任務目錄都遵循一致的結構:

<task-name>/
├── task_config.json         # 代理可使用哪些 MCP 伺服器
├── docs/
│   ├── task.md              # 顯示給代理的任務描述
│   └── agent_system_prompt.md
├── evaluation/main.py       # 自動化評估器
├── preprocess/main.py       # 資料庫狀態設定(每個任務前自動執行)
├── initial_workspace/       # 預先載入代理工作區的輸入檔案
└── groundtruth_workspace/   # 供評估使用的參考輸出

任務描述(task.md)撰寫時不包含工具或服務品牌名稱 — 像 "Notion"、"Google Calendar" 或 "Canvas" 之類的工具名稱,會以 "knowledge base"、"shared calendar" 或 "learning management system" 等通用描述進行遮蔽。這與原始 Toolathlon 專案採用的遮蔽慣例相同,可避免代理僅根據關鍵字辨識而走捷徑,並鼓勵真正的工具使用推理。

模擬資料庫

Connection: toolathlon_gym @ localhost:5432 (user: eigent, password: camel)

所有資料都來自本地 PostgreSQL 資料庫,並由壓縮轉存檔(db/init.sql.gz,8.2 MB)初始化。執行時不會進行任何外部 API 呼叫。這使得環境完全可控,並可避免 API rate limits、schema 變更或資料漂移等問題。

資料來源或模擬自真實世界資料:用於 Learning Management System 資料的 Kaggle OULAD(Open University Learning Analytics Dataset)、用於企業 HR 資料的 Kaggle HR Analytics、用於財務資料的 Yahoo Finance API,以及用於電商資料的 Kaggle Amazon product datasets 和 DummyJSON 的組合。

資料豐富的 schemas

MCP DatabaseDescriptionScale
canvasLearning Management System — 課程、使用者、選課、作業、繳交、測驗、rubrics、公告22 門課程、28,865 名使用者、32,663 筆選課、206 個作業、173,912 筆繳交、77 個測驗
snowflake企業資料倉儲 — HR analytics、銷售與客服中心領域50,000 名員工、20,000 筆銷售訂單、31,588 張支援工單
woocommerce電商 — 產品、訂單、客戶、優惠券、評論、配送區域、稅率82 項產品、150 筆訂單、50 位客戶、396 則評論
yahoo_finance股市 — 價格、財務報表、新聞、選擇權、持股人50 檔 ticker、3,510 筆價格紀錄
youtube影音平台 — 頻道、播放清單、影片、逐字稿3 個頻道、2 個播放清單、135 支影片
train鐵路系統 — 車站、列車、路線、座位8 班列車、16 條路線

資料集統計

總計:503 個任務

MCP 數量分布

任務所需的 MCP 伺服器數量介於 4 到 8 個之間,多數任務需要 4–7 個工具。較高的 MCP 數量表示需要更強的跨系統協調:代理必須在單一任務中編排更多異質工具、規劃更長的操作序列,並處理跨服務更複雜的資料流:

每個任務的 MCP 數任務數量
4123
5133
6105
7126
816

以下是各層級的代表性範例,展示任務複雜度與協調需求如何隨 MCP 數量增加而擴展。(由於原文過長,此處僅顯示任務摘要。)

4 個 MCPs — wc-customer-retention-email(woocommerce、excel、emails、filesystem)

從網路商店中找出總消費金額最高的前 10 位客戶。建立一個名為 VIP_Customer_Report.xlsx 的 Excel 試算表,欄位包含 Rank、Name、Email、Orders_Count 和 Total_Spent,並依金額由高到低排序。接著從 vip-program@store.example.com 向這 10 位客戶逐一寄送個人化感謝 email,稱呼他們的名字,並提及其總消費金額。

5 個 MCPs — 12306-beijing-shanghai-trip-notion-gcal-word(rail_12306、notion、google_calendar、word、emails)

規劃一趟北京與上海之間的當日往返行程。查詢 2026 年 3 月 10 日兩個方向可搭乘的高鐵,並根據時間選出最佳的去程與回程列車。將行程細節記錄到團隊知識庫中,建立一份包含三個章節(Outbound Journey、Return Journey、Booking Summary)的 Travel_Plan.docx,新增兩個涵蓋旅遊時段的行事曆事件,並寄送確認 email 至 travel@consulting.com。

6 個 MCPs — arxiv-conference-prep(scholarly、arxiv-latex、pptx、google_calendar、emails、filesystem)

為 RLHF Summit 2026 會議做準備。搜尋至少 5 篇關於人類回饋強化學習的論文,然後閱讀其完整 LaTeX 原始碼以擷取方法細節。建立一份 PowerPoint 簡報,包含標題頁、RLHF 領域概覽、每篇論文一頁,以及總結頁。為 2026 年 4 月 10 日的會議新增一則行事曆事件,並將準備資料寄送給合作夥伴。

7 個 MCPs — arxiv-research-pipeline-notion-excel(scholarly、arxiv_local、terminal、excel、notion、filesystem)

建立一個關於大型語言模型的研究知識庫。搜尋與 LLM、prompt engineering(提示工程)以及 in-context learning(上下文學習)相關的論文。使用 terminal 執行一個綜整腳本,讀取論文 metadata 與內容,計算相關性分數,並輸出結構化 JSON 摘要。建立一個包含三個工作表(Paper_Catalog、Method_Comparison、Research_Gaps)的 Excel 檔案,以及一個標題為 "LLM Research Hub" 的 Notion 頁面,內容包含研究儀表板、領域概覽、方法比較與已識別的缺口。

8 個 MCPs — arxiv-research-workflow-pipeline(scholarly、arxiv-latex、terminal、word、google_calendar、emails、pdf-tools、filesystem)

建立一條文獻回顧流程:先搜尋近期有關 neural network architectures(神經網路架構)的論文並下載其 PDF。解析這些論文的 LaTeX 原始碼,以擷取關鍵數學表示式,並將其整理成結構化格式。根據收集到的資料,建立一份附有正規學術引用的分類書目。接著撰寫一篇 2,000 字的研究摘要,綜整主要趨勢、指出研究缺口,並概述未來可能方向。最後,安排一場團隊審查會議,寄送附有摘要文件的行事曆邀請,並將所有工作檔案儲存在集中位置,供協作與未來參考。

MCP 伺服器涵蓋範圍

資料集共提供 25 個 MCP 伺服器,涵蓋檔案輸入/輸出、資料倉儲、生產力工具、網頁互動與特定領域 API。下表顯示每個伺服器被納入的任務數量,可看出哪些工具類別在環境中最常被使用:

MCP Server Task Count

最常使用的伺服器反映了任務偏向輸出導向的特性。filesystem 幾乎出現在每個任務中,作為代理讀取輸入檔案與寫入結果的工作區。excel 和 emails 是最常見的兩個輸出通道 — 大多數任務至少會產生一份結構化試算表並傳送一則摘要訊息。terminal 則要求代理撰寫並執行程式腳本,用於其他工具無法單獨處理的資料轉換或統計分析。

snowflake 是企業工作流程任務的主要資料來源,涵蓋三個領域:HR analytics(50,000 名員工、薪資、績效評分與年資資料)、銷售(跨區域與客戶區隔的 20,000 筆訂單),以及客服(31,588 張含 SLA 與處理狀態 metadata 的工單)。任務通常會查詢其中一或兩個領域、計算彙總值或標記離群值,並將結果寫入 Excel 或 Word。canvas 也同樣是 LMS 任務的核心,代理會依課程篩選繳交、計算成績分布,或從 22 門課程與 173,912 筆繳交的資料集中標記高風險學生。

playwright_with_chunk 與 fetch 都會從模擬的本地伺服器擷取資料 — playwright 任務會抓取 HTML 頁面(例如競爭對手簡介或產品列表),而 fetch 任務則會呼叫 REST API endpoints(例如產業薪資資料集或庫存預測),並將結果與資料倉儲紀錄進行關聯。google_forms 任務更進一步:代理會以程式方式建立結構化問卷,接著查詢訂單或選課資料以找出正確收件者,並寄送個人化邀請。

howtocook 提供食譜與營養資料庫,用於餐飲、餐點規劃與營養分析任務。pdf-tools 既可作為閱讀器(讀取作為輸入提供的參考 PDF),也可作為寫入器(產生格式化報告作為輸出)。memory 支援多輪研究任務,代理必須在多次迭代中追蹤搜尋進度,並避免重複查詢已擷取過的資料。youtube-transcript 會擷取影片錄影中的原始逐字稿文字,代理接著加以處理,產出結構化文件或問卷。

初始工作區檔案類型

在任務開始時提供給代理的初始工作區檔案類型共有 11 種,涵蓋代理在真實企業工作流程中可能遇到的各類文件。其分布反映了真實任務組成:Markdown 簡報與 PDF 參考文件最常見,其次是 JSON 與 Excel 等結構化資料格式,代理必須讀取、轉換並寫回:

Initial Workspace File Types

以下是初始工作區中最具代表性的檔案類型:

Markdown(.md) 檔案最常見,作為任務簡報、作業指南與規劃模板 — 例如 travel_guide.md(鐵路訂票任務的公司差旅政策)、analysis_methodology.md(銷售分析的統計方法),或 Research_Scope.md(文獻回顧的主題範圍)。

PDF(.pdf) 檔案是代理在行動前必須解析的參考文件 — 薪酬政策、投資組合準則、評分 rubrics 或稽核程序,其內容會直接決定正確輸出。JSON(.json) 檔案包含參數化設定:行程設定、篩選門檻、稽核條件、預算上限與團隊名單,讓任務可以在不更動描述的情況下變化。

Excel(.xlsx) 輸入通常是預先填好的範本,含有既定欄位標題,代理需要將內容填入(例如 paper_notes_template.xlsx、approved_budget.xlsx)。CSV(.csv) 檔案則包含表格式參考資料,代理會將其與資料庫結果進行比對與合併 — 產業薪資資料集、投資組合持股、師資名錄或供應商聯絡清單。Text(.txt) 檔案提供輕量級結構化內容:待下載的論文 ID 清單、email 內文模板、季度銷售目標或升級處理政策規則。

Python(.py) 腳本是代理透過 terminal 完成並執行的起始模板,測試其讀取既有程式碼、推斷意圖,以及將腳本輸出整合進更大工作流程的能力。較少見的格式各自扮演特定角色:.pptx 輸入是代理延伸而非從零建立的既有投影片;.docx 輸入是含有預設標題、供填寫內容的文件骨架;唯一的 .bib 檔案是種子書目,代理會以新發現的論文加以擴充;而唯一的 .gz 壓縮檔則必須先用 terminal 解壓,內容才能使用。

Toolathlon-GYM 的不同之處

規模與多樣性

在 25 個 MCP 伺服器與 6 個資料領域中包含 503 個任務,Toolathlon-GYM 的規模明顯大於此領域較早期的資料集,也具備更高的工具多樣性。任務設計旨在要求真正的跨系統協調,而非單一工具查詢。

完全本地且可重現

整個環境透過單一 Docker Compose 檔案執行。評估時不需要任何資料服務的 API 金鑰。PostgreSQL 轉存檔有版本控管且具確定性,因此可在不同機器與不同時間點重現結果。

真實的任務複雜度

任務取材自真實企業工作流程樣態:從 HR 資料庫擷取資料以產生薪資分析試算表、將 Learning Management System 的繳交紀錄與行事曆截止日交叉比對、根據抓取的網頁資料產生投影片,以及其他類似的多步驟目標。大多數任務都需要 4–7 個工具才能正確完成。

致謝

Toolathlon-GYM 建立於以下專案的基礎架構與原始資料管線之上:

Toolathlon: Benchmarking LLM Agents on Real-World Tool-Use Tasks HKUST-NLP https://github.com/hkust-nlp/Toolathlon

模擬資料庫 schema 設計、MCP 伺服器介面與任務評估框架皆源自 Toolathlon 專案。本資料集在原始版本基礎上擴充了更多任務與更大規模的模擬資料。

引用

如果您在研究中使用 Toolathlon-GYM,請引用:

@misc{toolathlon-gym,
  author    = {Puzhen Zhang and Weijie Bai and Wendong Fan and Guohao Li},
  title     = {{Toolathlon-GYM: Large-Scale Long-Horizon Environments for Tool-Use Agents}},
  year      = {2026},
  url       = {https://github.com/eigent-ai/toolathlon_gym}
}

聯絡方式

如果您想與我們聯繫,請聯絡 info@eigent.ai

Recent Posts

Cursor 替代方案(免費且開源):屬於你的工作空間
Jul 23, 2026

Cursor 替代方案(免費且開源):屬於你的工作空間

在 SpaceX 收購案後,尋找免費開源的 Cursor 替代方案?比較成本、自架部署、模型選擇與資料存放地點,並了解遷移路徑。

EigentEigent
Claude Record a Skill:用螢幕錄影教 Claude 學習工作流程
Jul 22, 2026

Claude Record a Skill:用螢幕錄影教 Claude 學習工作流程

Claude 的 Record a skill 功能可將螢幕錄影轉換為可重複使用的技能。了解其運作方式、適用方案、設定步驟及使用限制。

EigentEigent
Cursor Router 完整解析:以更低成本實現頂尖程式碼品質
Jul 22, 2026

Cursor Router 完整解析:以更低成本實現頂尖程式碼品質

Cursor Router 自動為每個程式開發請求選擇最佳模型,在維持頂尖品質的同時降低成本。了解其運作原理、三種模式及相關取捨。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 全新版本發佈!download