一句话定位:“工具十项全能”——32 个真实软件应用、604 个 MCP 工具、108 道长程跨应用任务的 agent 工具使用基准(HKUST NLP 主导,联合 All Hands AI/CMU/Duke,ICLR 2026);Verified 是 2026-06-30 发布的当前版本,修任务、修基建、保评测可靠性。
为什么值得关注
- 打的是现有 agent 基准三大硬伤:领域窄(单工具/单 API)、任务假(一两步调用完事)、环境假(空白初始状态)——本基准要跨应用多步协作,且初始环境是真实软件状态(几十个学生的 Canvas 课程、真实财务表格等)
- 严格可验证:每题有专门评测脚本做 execution-based 判分,没有 LLM judge 的主观空间
- 全链路开源:任务/工具/评测脚本开源,连 17 个模型 × 3 次的完整执行轨迹(5000+ 条)都放出来了,可审计可分析
- 进步曲线陡峭且诚实:论文时点 SOTA 38.6%,8 个月后 76.5%——真实长程工具使用是当前 agent 的核心瓶颈也是主战场
评测集构成
| 项 | 说明 |
|---|---|
| 应用/工具 | 32 个软件应用、604 个工具:日常向(Google Calendar、Notion)到专业向(WooCommerce、Kubernetes、BigQuery);多数基于高质量 MCP server(团队修订或自研) |
| 任务 | 108 道人工搜集/设计,平均需 ~20 轮交互、跨多个应用 |
| 任务示例 | NVIDIA 机构持股 8 季度趋势分析→拆股调整→填 xlsx;发票核验报销单;W&B runs 汇总同步进 Notion;各城市 SQLite 库存同步到 WooCommerce;Canvas 收作业→运行判对错→打分;K8s 部署 PR 预览分支;国米 UCL 决赛数据填 Google Sheets |
| 评分 | Pass@1(主指标)+ Pass@3 + Pass^3(一致性)+ 平均轮数/工具调用数 |
| 发布方 | HKUST NLP(Junlong Li 等 21 人)+ All Hands AI + CMU + Duke |
版本线:
| 版本 | 时间 | 说明 |
|---|---|---|
| Toolathlon v1 | 2025-10-29 | 论文发布(arXiv:2510.25726),SOTA Claude-4.5-Sonnet 38.6%(平均 20.2 轮工具调用),开源最强 DeepSeek-V3.2-Exp 仅 20.1% |
| v2 论文修订 | 2026-02-26 | 论文更新 |
| Toolathlon-Verified | 2026-06-30 | 当前版本:大量任务与支撑基建修订以保证任务正确性和评测可靠性,经大量实验验证 |
排行榜
模型分数见 toolathlon(Toolathlon-Verified 官方榜快照,榜首 Kimi K3 76.5%)。
设计层面观察:Verified 修订与 swe-bench-verified、Terminal-Bench 2.1 同款动作——第一代基准普遍存在任务缺陷/评测不稳,社区进入”验证修订”阶段。
局限性
- 108 题规模小,单题波动可见(stderr ±1-3.4%)
- 任务以信息处理/办公自动化为主,不覆盖纯软件工程(见 swe-bench-verified)和从零建应用(见 vibe-code-bench)
- MCP server 实现质量本身会引入环境噪声(Verified 修订主要解决这个)
资源
- 官网:https://toolathlon.xyz/(榜单/任务列表/轨迹/文档,提供 /llms.txt 索引)
- 论文:The Tool Decathlon,https://arxiv.org/abs/2510.25726(ICLR 2026)
- 代码:https://github.com/hkust-nlp/toolathlon
- 轨迹数据:HuggingFace
hkust-nlp/Toolathlon-Trajectories(17 模型 × 3 runs)
相关页面
- toolathlon — 本基准榜单快照
- terminal-bench — 终端环境长程任务基准(同为 agent 执行类主战场)
- swe-bench-verified — 修 GitHub issue 基准(“Verified”命名先例)
- vibe-code-bench — 从零建应用基准
- 2605.10912_wildclaw-bench — WildClawBench:另一种长时域真实任务基准