评测集定义与方法论见 terminal-bench。本页只放分数:各模型在终端环境完成真实工作流任务的能力强度。
版本警示:4.0(2026-08-28)对任务集与资源要求做了 breaking change,官方要求重跑试验,因此与 2.x / 3.0 不作同口径直接比较。2.1 已饱和,其高分不可平移到 4.0。
TB 4.0 官方榜(抓取于 2026-09-14,66 题 / 7 领域 / 统一 8 小时超时 / 每任务 5 trials)
| # | 模型 + Agent | Accuracy | 备注 |
|---|---|---|---|
| 1 | GPT-6 Astra Max + Codex | 58.2% ±2.8 | 2026-09-03 |
| 2 | Claude Fable 5.1 Max + Claude Code | 57.9% ±3.8 | 2026-09-01 |
| 3 | Claude Opus 5 Max + Claude Code | 51.8% ±3.4 | — |
| 4 | GLM-5.3 Max + Claude Code | 41.8% ±3.2 | — |
4.0 公开成本与 token 量级差异显著:头部同为 50%+ 档,GPT-6 Astra 约 1.5B token / 6.2k,Sonnet 5 约 21.6B token / $9.6k。
注意:4.0 主动移除了 8 道饱和或公开解法的题,榜首因此从 2.1 的 83.8% 回落到 58.2%——这是换尺,不是能力退步。
TB 2.1 官方榜(历史快照,抓取于 2026-08-13,共 20 条提交,每任务 ≥5 trials,n=445)
accuracy 为任务解决率,reward hacks 为钻空子扣分率:
| # | 模型 | effort | Agent | Accuracy | 成本/trial | hacks | 日期 |
|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | xhigh | Claude Code | 83.8% ±1.2 | $1.24 | 0.2% | 2026-06 |
| 2 | GPT-5.5 | xhigh | Codex | 83.2% ±1.1 | $4.63 | 0.2% | 2026-05 |
| 3 | Claude Fable 5 | high | Terminus 2 | 80.5% ±1.2 | $0.99 | 0% | 2026-06 |
| 4 | Grok 4.5 | high | Cursor CLI | 79.3% ±1.5 | $0.30 | -9.0% | 2026-07 |
| 5 | Claude Opus 4.8 | high | Claude Code | 78.9% ±1.3 | $0.64 | 0% | 2026-07 |
| 6 | GPT-5.6 Terra | max | Codex | 78.4% ±1.3 | $0.95 | 0.2% | 2026-07 |
| 7 | GPT-5.5 | xhigh | Terminus 2 | 78.0% ±1.2 | $1.11 | 0.2% | 2026-05 |
| 8 | GPT-5.6 Sol | max | Codex | 76.2% ±1.3 | $1.29 | 7.2% | 2026-07 |
| 9 | Muse Spark 1.1 | xhigh | mini-SWE-agent | 76.2% ±1.2 | $0.45 | 0% | 2026-07 |
| 10 | GPT-5.6 Luna | max | Codex | 75.7% ±1.3 | $0.54 | 0.9% | 2026-07 |
| 11 | Claude Sonnet 5 | high | Claude Code | 74.6% ±1.6 | $0.65 | 0.7% | 2026-07 |
| 12 | GPT-5.6 Terra | max | Codex | 74.4% ±1.5 | $0.90 | 7.2% | 2026-07 |
| 13 | Gemini 3 Pro | high | Terminus 2 | 73.9% ±1.3 | $0.50 | 0.5% | 2026-05 |
| 14 | GPT-5.6 Luna | max | Codex | 71.2% ±1.4 | $0.49 | 7.4% | 2026-07 |
| 15 | Claude Opus 4.7 | max | Claude Code | 68.9% ±1.4 | $1.34 | 0.5% | 2026-05 |
| 16-20 | Opus 4.7/Terminus 2 66.1% · Gemini 3 Pro/Gemini CLI 65.8% · Gemini 3.1 Pro 两种 harness 65.6-65.8% · GLM-5.1/Claude Code 58.7% |
(pass@5:榜首两条为 0.955/0.937,头部模型多次尝试基本能解出绝大多数题)
分数观察
- 版本切换是最大变量:2.1 → 4.0 换题集与资源口径后,榜首从 83.8% 回落至 58.2%,两版分数不可比;引用时必须写清版本
- harness 影响 5+ 分:GPT-5.5 在 Codex 83.2% vs Terminus 2 78.0%;Gemini 3.1 Pro 两个 harness 仅差 0.2 分——harness 与模型的匹配度是榜单位置的一半
- 成本差 15x:同为前列成绩,Grok 4.5 4.63/trial;4.0 里头部同档的 token 消耗可差一个数量级(1.5B vs 21.6B)
- reward hacking 集中:2.1 中 Grok 4.5(-9.0%)与 GPT-5.6 Codex 三条(7.2-7.4%)显著高于其他模型(≤0.9%);4.0 已专门剪枝此类题目,但读榜仍须看这一列
- 社区提交暂关闭:目前仅收 maintainer 自行运行的结果,榜单扩张速度受控
相关
- coding-agent-leaderboards — Coding Agent 榜单横向地图与可信度分层
- terminal-bench — 评测集定义与方法论
- harbor — 官方执行框架