评测集定义与方法论见 terminal-bench。本页只放分数:各模型在终端环境完成真实工作流任务的能力强度。

版本警示:4.0(2026-08-28)对任务集与资源要求做了 breaking change,官方要求重跑试验,因此与 2.x / 3.0 不作同口径直接比较。2.1 已饱和,其高分不可平移到 4.0。

TB 4.0 官方榜(抓取于 2026-09-14,66 题 / 7 领域 / 统一 8 小时超时 / 每任务 5 trials)

#模型 + AgentAccuracy备注
1GPT-6 Astra Max + Codex58.2% ±2.82026-09-03
2Claude Fable 5.1 Max + Claude Code57.9% ±3.82026-09-01
3Claude Opus 5 Max + Claude Code51.8% ±3.4—
4GLM-5.3 Max + Claude Code41.8% ±3.2—

4.0 公开成本与 token 量级差异显著:头部同为 50%+ 档,GPT-6 Astra 约 1.5B token / 6.2k,Sonnet 5 约 21.6B token / $9.6k。

注意:4.0 主动移除了 8 道饱和或公开解法的题,榜首因此从 2.1 的 83.8% 回落到 58.2%——这是换尺,不是能力退步。

TB 2.1 官方榜(历史快照,抓取于 2026-08-13,共 20 条提交,每任务 ≥5 trials,n=445)

accuracy 为任务解决率,reward hacks 为钻空子扣分率:

#模型effortAgentAccuracy成本/trialhacks日期
1Claude Fable 5xhighClaude Code83.8% ±1.2$1.240.2%2026-06
2GPT-5.5xhighCodex83.2% ±1.1$4.630.2%2026-05
3Claude Fable 5highTerminus 280.5% ±1.2$0.990%2026-06
4Grok 4.5highCursor CLI79.3% ±1.5$0.30-9.0%2026-07
5Claude Opus 4.8highClaude Code78.9% ±1.3$0.640%2026-07
6GPT-5.6 TerramaxCodex78.4% ±1.3$0.950.2%2026-07
7GPT-5.5xhighTerminus 278.0% ±1.2$1.110.2%2026-05
8GPT-5.6 SolmaxCodex76.2% ±1.3$1.297.2%2026-07
9Muse Spark 1.1xhighmini-SWE-agent76.2% ±1.2$0.450%2026-07
10GPT-5.6 LunamaxCodex75.7% ±1.3$0.540.9%2026-07
11Claude Sonnet 5highClaude Code74.6% ±1.6$0.650.7%2026-07
12GPT-5.6 TerramaxCodex74.4% ±1.5$0.907.2%2026-07
13Gemini 3 ProhighTerminus 273.9% ±1.3$0.500.5%2026-05
14GPT-5.6 LunamaxCodex71.2% ±1.4$0.497.4%2026-07
15Claude Opus 4.7maxClaude Code68.9% ±1.4$1.340.5%2026-05
16-20Opus 4.7/Terminus 2 66.1% · Gemini 3 Pro/Gemini CLI 65.8% · Gemini 3.1 Pro 两种 harness 65.6-65.8% · GLM-5.1/Claude Code 58.7%

(pass@5:榜首两条为 0.955/0.937,头部模型多次尝试基本能解出绝大多数题)

分数观察

  1. 版本切换是最大变量:2.1 → 4.0 换题集与资源口径后,榜首从 83.8% 回落至 58.2%,两版分数不可比;引用时必须写清版本
  2. harness 影响 5+ 分:GPT-5.5 在 Codex 83.2% vs Terminus 2 78.0%;Gemini 3.1 Pro 两个 harness 仅差 0.2 分——harness 与模型的匹配度是榜单位置的一半
  3. 成本差 15x:同为前列成绩,Grok 4.5 4.63/trial;4.0 里头部同档的 token 消耗可差一个数量级(1.5B vs 21.6B)
  4. reward hacking 集中:2.1 中 Grok 4.5(-9.0%)与 GPT-5.6 Codex 三条(7.2-7.4%)显著高于其他模型(≤0.9%);4.0 已专门剪枝此类题目,但读榜仍须看这一列
  5. 社区提交暂关闭:目前仅收 maintainer 自行运行的结果,榜单扩张速度受控

相关