一句话定位:衡量 AI agent 在命令行终端环境里完成高价值复杂任务能力的基准(Stanford × Laude Institute 出品)——4.0 为 66 道容器内的真实工作流任务(编内核、配 git 服务器、破解 7z 密码、恢复 WAL 数据库、COBOL 现代化……),是当前 agent harness 军备竞赛的主战场之一。
为什么值得关注
- 任务来自真实工作流:每道题有独立容器环境 + 人工编写解法 + 完备验证测试,覆盖 system-admin/security/data-science/model-training/coding 等域,比修 bug 更考验长时域操作能力
- reward hacking 显式追踪:榜单单独列 reward hack 率(有模型高达 7-9%),是少数把”钻测试空子”当一等指标处理的基准
- 榜单数据全开源:提交结果 JSON 直接放在 GitHub 仓库里(含 pass@k/成本/token/时长),可审计可复算
- 配套 meta-harness 等 harness 优化研究都以本榜为标尺;衍生出 Terminal-Bench Challenges(长时单任务)和 terminal-bench-science(自然科学方向,开发中)
评测集构成
| 项 | 说明 |
|---|---|
| 任务数 | 4.0 为 66 道;历史版本 2.0/2.1 为 89 道,1.0 为 80 道 |
| 任务形态 | 容器内终端任务:自然语言指令 + 专属 Docker 环境;例:build-linux-kernel-qemu(源码编内核并用 QEMU 启动)、configure-git-webserver、crack-7z-hash、openssl-selfsigned-cert、reshard-c4-data、train-fasttext、db-wal-recovery |
| 验证 | 每题人工写解法 + 综合测试自动判定;agent 容器与 verifier 容器隔离 |
| 运行框架 | Harbor(harbor-framework):评测/优化 agent 的统一 runner,支持云沙箱并行;数据与 job 托管在 Harbor Hub |
版本演进:
| 版本 | 时间 | 变化 |
|---|---|---|
| 1.0 | 2025-05-19 | 首发 80 任务(Laude Institute),早期 frontier agent 正确率普遍不高 |
| 2.0 | 2025-11-07 | 扩到 89 任务并加难;论文(arXiv:2601.11868,2026-01 提交)报告当时最强模型/agent < 65% |
| 2.1 | 2026-05-06 | 加强验证的迭代:修 28 道题的 bug/超时资源/抗 reward hacking;榜单 2026-07-07 建立,现已饱和 |
| 3.0 | 2026-07-30 | 收缩为 74 题 / 7 域,首次引入多容器、GPU、Lean、CAD 等新场景 |
| 4.0 | 2026-08-28 | 收缩为 66 题,统一 8 小时超时,移除 8 道饱和/公开解法题。任务集与资源要求 breaking change,与 2.x/3.0 分数不可直接比较 |
排行榜
4.0 当前榜首 GPT-6 Astra Max + Codex 58.2%±2.8(2026-09)。历史 2.1 榜首为 Claude Fable 5 + Claude Code 83.8%,两者不可比。分数、成本与 reward hacks 详见 terminal-bench,横向读法见 coding-agent-leaderboards。
局限性
- 单任务容器环境,任务间无状态延续(长时域连续工作流由 Terminal-Bench Challenges 补位)
- 任务仍以工程/运维向为主,科研场景(terminal-bench-science)尚在开发
- 任务规模小:4.0 仅 66 题,单题波动对总分影响可见;每任务 5 trials,官方报 95% 置信区间
- 与 vibe-code-bench 一样存在跨榜排名不迁移现象(同一模型在不同基准相对位置差异大)
资源
- 官网:https://www.tbench.ai/(榜单/任务样例/贡献者/新闻)
- 2.1 榜单数据仓库:https://github.com/harbor-framework/terminal-bench-2-1(tasks/ + leaderboard/submissions/ 全量 JSON)
- 论文:Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces,https://arxiv.org/abs/2601.11868
- Harbor 框架:https://github.com/harbor-framework/harbor ;数据集:Harbor Hub
terminal-bench/terminal-bench-2-1
相关页面
- terminal-bench — 本基准榜单快照
- harbor — 本基准的官方评测执行框架(Laude Institute / Stanford 出品)
- meta-harness — Terminal-Bench-2 上拿过 #1/#2 的 Harness 自动优化框架
- swe-bench-verified — 修 GitHub issue 基准(mini-SWE-agent 同时出现在两榜)
- vibe-code-bench — 从零建应用基准(同样观察到跨榜排名不迁移)
- humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
- codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
- toolathlon — Toolathlon:跨应用长程工具使用基准(同为 agent 执行类主战场)
- deepswe — DeepSWE:原创长时域 SWE 基准(同系列评测集)