数据截至 2026-09-18。本页回答三个问题:有哪些榜、每个榜考什么、能不能信。单榜细节与分数快照见 benchmarks、leaderboards 及各详情页。

一句话结论:榜单不是一把尺。看名次之前先确认四件事——谁跑的、锁没锁 harness、哪个版本、带不带成本和时长。

榜单地图

类别代表榜单回答什么问题
仓库级修复SWE-bench 家族、SWE-bench Pro、SWE-bench-Live、SWE-rebench、Multi-SWE-bench、SWE-PolyBench能不能读懂 issue、跨文件改对,且不破坏回归测试
终端与长时域Terminal-Bench 4.0、DeepSWE、SWE-Lancer、Aider Polyglot、LHTB、SWE-Marathon、FrontierSWE能不能在真实环境跑通多步流程,并撑住小时级任务
端到端交付Vibe Code Bench、Code Arena(Agentic/Fullstack)、Design Arena(Agentic)能不能从一句话需求交付可用的完整应用
独立复核与组合Vals AI、Artificial Analysis Coding Agent Index换成中立跑法后,厂商自报分还剩多少
纵向专项MLE-benchML 工程这类细分方向 agent 能做到什么程度
harness 型(非代码修复)DuMateBench、Toolathlon换了 harness 到底值多少分——直接给 agent 框架排名

看榜先问四个问题

  1. 谁跑的? 厂商自报、榜单方统一复跑、独立第三方复跑,三者可信度不同。
  2. 锁 harness 了吗? 同一模型换 agent 框架的分数波动,可能比模型之间的差距还大。
  3. 哪个版本、哪一天? 换版本等于换尺,跨版本比大小无意义。
  4. 带成本和时间吗? 同分不等于同等可用性。

2026 年标志性变化

  • OpenAI 已公开停止上报 SWE-bench Verified,理由是该榜无法再提供有意义信号,转向 SWE-bench Pro 一类抗污染评测。
  • Terminal-Bench 于 2026-08-28 升级到 4.0:任务集与资源要求做了 breaking change,官方要求重跑试验。榜首从 2.1 的约 84% 回落到 4.0 的 58.2%,属换尺而非退步。
  • SWE-bench Pro 在 2026-09 被审计出泄漏型 reward hacking:可通过 Git 历史、隐藏答案文件、在线仓库、任务元数据反查解法。封堵后修正分数落在约 49.9%–62.9%。
  • Multi-SWE-bench 把 C/C++/Java 从 8–23% 推到 47–54%(2025-04 论文 → 2026-07 社区提交):多语言榜仍未饱和,且主力是工业团队而非学术机构。
  • DuMateBench(2026-08-27)把 harness 变成可排名的对象:同一 Opus-4.8 换 harness 分差可达 27 分,国内首次出现开放提交、直接给 agent 框架排名的榜。

仓库级修复类

SWE-bench(Full / Lite / Verified)

  • 考什么:真实 Python 仓库定位问题、跨文件修改、保证回归测试不破
  • 维护方:Princeton SWE-bench 团队;Verified 于 2024-08 与 OpenAI 联合发布
  • 形态:Full 2,294 / Lite 300 / Verified 500 题;Docker 沙箱内读 issue、改仓库、提交 patch
  • 指标:% Resolved,须同时通过 FAIL_TO_PASS 与 PASS_TO_PASS
  • 现状:官方 Bash-Only 榜首 76.8%(Claude 4.5 Opus high,2026-02,数据未再刷新);Vals AI 独立复跑 97.0%(Claude Opus 5,2026-09,该独立榜已因饱和归档)
  • 风险:两者不是同一口径,不可并列;公开题集已被证实存在训练污染
  • 详见 swe-bench-verified、swe-bench-verified

SWE-bench Pro(Scale AI)

  • 考什么:长时域、跨文件、企业级仓库任务,强调真实需求规格与抗污染
  • 形态:1,865 题(731 公开 / 858 留出 / 276 商业),41 仓库,Python·Go·JS·TS;平均改 4.1 文件、107.4 行
  • 指标:Pass@1 / % Resolved
  • 现状:2025-09 发布时公开集最高约 23%;2026-09 审计修正后约 49.9%–62.9%
  • 风险:公开、留出、商业三套口径不能混用;当前最值得盯的抗污染主榜之一

防污染滚动榜:SWE-bench-Live 与 SWE-rebench

  • SWE-bench-Live(Microsoft):持续新增真实 issue 替代静态题集;Lite 榜首 63.0%(AMI Agent + Claude 4.6 Opus,2026-06);2026-08 起才强制提交 rollout 轨迹,历史条目仍属提交方口径
  • SWE-rebench(Nebius):只用模型发布后产生的新 PR 构题 + 统一 ReAct scaffold;最近窗口 111 题,Fable 5 High 64.5%、Grok 4.5 High 63.8%、Opus 5 High 63.4%
  • 共同注意:任务池滚动更新,月度分数不是固定题集的纵向曲线,不要把跨月数字连成趋势

多语言与多模态分支

  • Multi-SWE-bench(字节 Seed):1,632 题、七语言(Java 128 / TS 224 / JS 356 / Go 428 / Rust 239 / C 128 / C++ 129)、39 仓库、68 名专家双标注;唯一按语言切榜、公司可自助 PR 提交的多语言榜,当前 C 54.3% / Java 47.9% / C++ 47.3%,但无防污染设计。详见 multi-swe-bench、multi-swe-bench、multi-swe-bench
  • SWE-PolyBench(Amazon Science):2,110 题 / 21 仓库,JS+TS 占 83%;另报语法树定位检索指标
  • 官方扩展轴:SWE-bench Multilingual 300 题 / 9 语言;SWE-bench Multimodal v2 于 2026-09-01 修订为 480 题
  • 共同注意:多语言绝对分普遍低于 Python 单语榜;Multimodal 的 V1 与 V2 分数不可直接比较

终端与长时域

Terminal-Bench 4.0

  • 考什么:容器化终端里自主完成真实多步工作流,考探索—执行—失败恢复闭环
  • 维护方:Stanford × Laude Institute,执行框架 Harbor
  • 形态:4.0 为 66 题、7 领域、统一 8 小时超时;每题独立容器,agent 与 verifier 隔离,5 trials
  • 指标:Resolution rate(自动 verifier),同时公开成本、token、步数与 reward hack 率
  • 现状:2026-09 榜 GPT-6 Astra Max + Codex 58.2%±2.8、Claude Fable 5.1 Max + Claude Code 57.9%±3.8
  • 风险:测的是「模型 + agent 框架」组合,不是裸模型;2.1 已饱和,历史高分不可平移到 4.0

DeepSWE(Datacurve)

  • 考什么:防污染长时域原创 SWE 任务,拉开饱和榜上挤成一团的前沿模型
  • 形态:113 道原创任务、91 仓库、5 语言,从零编写而非改编 PR;统一 mini-swe-agent + 沙箱
  • 指标:Pass@1 + 95% CI,行为型 verifier,另列成本、token、步数
  • 现状:2026-09-03 榜 GPT-6 Astra(xhigh)、Gemini 3.8 Flash(high)、Claude Opus 5(max)均为 74%;同分档成本相差约 5 倍
  • 风险:三个 74% 对应不同推理档位,非同设置对比;113 题样本小
  • 详见 deepswe、deepswe

其他长时域/终端榜

榜单定位状态提示
SWE-Lancer(OpenAI)真实外包任务,能力映射为经济价值榜已停更,2026 分数多为自报
Aider Polyglotaider edit loop 内改代码 + diff 格式落地官方榜停在 2025-10,仅历史参照
Long-Horizon-Terminal-Bench终端任务拉到百步/小时级,46 题2026-07 新榜,前沿模型平均仅 4.3%
SWE-Marathon20 多小时任务,单题均 2,720 万 token题量小、复现贵,第三方口径差异大
FrontierSWE v2小时到数十小时的模块级项目交付,34 题v1→v2 三处 breaking change,不可比

端到端交付与独立评测

Vibe Code Bench(Vals AI)

  • 考什么:从一页自然语言规格交付完整可用 Web 应用
  • 形态:100 个应用 spec(50 公开 + 50 隐藏)、964 条浏览器工作流、10,131 substep;OpenHands 配 Supabase/Stripe/MailHog,最长 5 小时/1000 轮
  • 现状:2026-09-15 更新,Claude Fable 5 90.35%、GPT-6 Astra 89.59%
  • 风险:数据集不公开,分数绑定固定 OpenHands harness;浏览器评测器有误差
  • 详见 vibe-code-bench

Code Arena(Arena.ai,原 LMArena)

  • 考什么:实时可检查的 agentic coding,多轮调用工具、创建文件、持久化会话
  • 形态:用户盲投对比;2026-07 起 Fullstack 支持 PostgreSQL、认证、RLS、Vercel 部署
  • 现状:2026-09-11 快照 679,295 票 / 128 模型,GPT-6 Astra Max 1800±16
  • 风险:核心是人类偏好,不等于客观正确率;只看 Fullstack/Agentic 口径

Artificial Analysis Coding Agent Index

  • 考什么:把「模型 + harness + 执行设置」当系统,统一跑三类任务
  • 形态:v1.5 共 303 题 = DeepSWE v1.1 113 题 + Terminal-Bench 4.0 66 题 + SWE-Atlas-QnA 124 题
  • 现状:2026-09 榜首 Claude Code + Fable 5.1 Max 62.22,Codex + GPT-6 Astra Max 61.65
  • 风险:等权综合掩盖任务域强弱;v1.0→v1.5 组件多次替换,不能跨版本比

Vals AI 独立复跑

  • 定位:第三方统一 harness 重跑经典榜,检验厂商自报分含金量
  • 现状:SWE-bench Verified 2026-09-01 榜首 Claude Opus 5 97.0%,该榜已因饱和归档
  • 风险:不宜当作「当前统一榜」;独立机构同样存在客户与模型方的商业关系

DSBench-FullStack(DeepSeek)

内部全栈测试集,题目、验证器、轨迹均未公开,只有厂商公布总分。不可复现,仅作方向信号,不是公开榜。

MLE-bench(OpenAI,纵向专项)

75 个 Kaggle 竞赛,默认 24 小时/36 vCPU/24GB A10;指标为相对人类榜的奖牌率。当前首位约 64.4%(2026-02);官方自 2026-04-24 起临时暂停接收新提交。不应与通用 Coding Agent 榜混排比较。

harness 型 Agent 榜(非代码修复)

有一类榜不测「修 issue」,而是直接给 agent 框架排名——它们共同的问题是「换了 harness 值多少分」。harness 型团队(自研/二开 agent)应把这类榜和代码修复类榜分开看。

DuMateBench(百度搭子)

  • 考什么:200 道真实用户 session 重建的办公交付任务,在缺工具(Insufficient)/ 网络抖动(Unstable)/ 脏目录(Noisy)三类环境里产出可交付产物
  • 形态:8 大类场景 / 17 任务类型;能力覆盖 Text 160 · Code 88 · Web 86 · Files 34 · Multimedia 46;5 harness × 4 基座 = 20 组
  • 指标:F = 0.3P + 0.7J(P 为确定性原子检查,J 为 artifact 级 LLM Judge)
  • 现状:5 harness 为 DuMate / Hermes / Claude Code / OpenClaw / OpenCode,OpenCode 最低 69.1。详见 dumatebench
  • 风险:厂商自办且自己第一(DuMate 在 4 个基座模型下全排第一)、Judge 占 70% 权重、发布仅 2026-08、published.json 为空(尚无外部提交上站)
  • 对公司的意义:国内唯一开放提交、直接排 harness 的 Agent 榜,且与 Terminal-Bench 共用 Harbor,适配投入可复用。但它不测代码修复能力,不能替代 SWE 类榜

Toolathlon

  • 32 应用 / 604 MCP 工具 / 108 任务,真实初始环境 + 硬判分,跨应用长程工具使用

一句话分工:代码修复能力看 SWE-bench-Live;harness 工程能力看 DuMateBench / Terminal-Bench;多语言泛化看 Multi-SWE-bench。

打榜可提交性(能不能刷)

榜单的「能不能读到」和「能不能提交」是两件事。想打榜时先确认提交入口,很多榜对非学术机构是关闭的。

榜单提交方式门槛适用对象
SWE-bench-LivePR 到 SWE-bench-Live/submissions2026-08 起强制提交 agent rollout 轨迹,maintainer 人工核验后挂 Verified 标签任何团队,自助可提交
Terminal-Bench 4.0自行用 Harbor 跑完并上传 Harbor Hub(默认私有)社区提交已正式关闭,仅维护方跑的结果进榜;需 GPU 沙箱(Modal/Daytona),8h×66 题×5 trials有预算且能与维护方建立联系的团队
Multi-SWE-benchPR 到 multi-swe-bench/experiments,按 evaluation/<语言>/verified/ 分目录必交 all_preds.jsonl + results.json + logs/ + metadata.yaml + trajs/;Verified ✓ 需另开 issue 让维护方在随机子集复跑多语言 agent 团队,公司可自助提交
DuMateBenchHarbor run --upload --public + 提 manifest PR200 题 × ≥5 trials(1000+ rollout);不得改 fairness 超时/资源参数;CI 从 Harbor 重拉并复算 P/J/F;合并 bot PR 后还需维护者加进 published.json 才上站任意 Harbor 兼容 agent,公司可自助提交
LHTBHarbor + HuggingFace PR,参照 Terminal-Bench 2 流程统一 terminus-2 harness、90 分钟预算、1 trial/题学术或长时域研究
SWE-bench 官方榜(Lite/Verified/Multilingual)PR 到 SWE-bench/experiments2025-11-18 起仅收学术团队与研究机构,要求方法开源且有同行评审论文学术界;工业界基本被排除
Vals AI / Artificial Analysis / Code Arena无自助入口,由评测方自行选择纳入需被评测方选中已有知名度的模型/产品

要点:

  • 想自助、要可信度 → SWE-bench-Live 是当前唯一同时满足「抗污染 + 强制轨迹核验 + 任意团队可提交」的 Coding Agent 榜;成本量级 7k,不是几十美元。
  • 想省钱补多语言维度 → Multi-SWE-bench 可按语言单独提交(Java 128 题),单语言成本比整榜低一个量级;但无防污染设计 + 分母漂移,只能当补充证据。
  • 想证明 harness 工程能力 → 国内走 DuMateBench(开放提交、直接排 harness、与 Harbor 复用,门槛 1000+ rollout);国外 Terminal-Bench 4.0 最有说服力,但社区提交通道当前关闭,只能自证。
  • harness 是卖点时不要选 DeepSWE / SWE-rebench:它们用统一 scaffold,会把你的 harness 优势直接抹平。
  • SWE-bench Verified 已被 OpenAI 停止上报、且只收学术提交,工业界刷它性价比最低;Multi-SWE-bench 与 DuMateBench 则相反,主力就是工业团队。

读榜通则

  1. 污染分两层:训练期污染(题目答案进过语料)与运行期取答案(读 Git 历史、公网、metadata、答案文件)。SWE-bench Pro 封堵泄漏后,有模型从 78.8% 掉到 57.3%。
  2. harness 影响可能大于模型:同一模型换 scaffold 的观测区间可达约 30 个百分点。优先看锁定 harness 的视图(Bash-Only、DeepSWE、Artificial Analysis)。
  3. 先问谁跑的:官方统一复跑、第三方独立复跑、厂商自报是三种可信度;同一榜名下 76.8% 与 97.0% 可以同时成立。
  4. reward hack 要看独立列:没有 hack 追踪的榜,高分要打折看。
  5. 指标口径逐字对齐:resolved rate、pass@1、pass@k、Elo、综合指数是五种东西。pass@k 是「k 次里至少一次对」,系统性高估单次可靠性;Elo 是同一投票池内的相对强度。
  6. 同分不等价:成本、token、轮数、时长必须和分数一起读。
  7. 警惕饱和与版本漂移:头部差距小于置信区间时排名无统计意义;跨版本分数不可续接。

风险清单

风险影响识别方法应对
训练期数据污染分数含默写成分看 cutoff 说明、能否凭题号复现 gold patch优先滚动与原创集
运行期反查答案可虚高 10–20 个百分点查是否单 commit、断网、测试移出 workspace只看封闭 harness 复跑分
harness 未锁定榜位测的是模型+框架问 agent 列表、工具集、轮数、推理档位用同 harness 视图或自做对照
厂商自报无复核发布数字高于标准化复跑看是否进官方榜或第三方复跑自报分只当上限方向
指标口径混用把不同东西当同一把尺读表头脚注,确认 k、试验次数、平均方式引用写全口径,跨榜只做定性
榜单饱和头部挤在一起看头部差距是否小于置信区间改用未饱和新榜
小样本一题波动改变名次看任务数与 CI 宽度只在 CI 不重叠时谈差距

不在本页范围

以下榜单很热门,但考的是基座模型的单轮代码能力或主观偏好,不涉及 agent 循环、工具调用与端到端交付:LiveCodeBench、Codeforces rating、HumanEval / MBPP / BigCodeBench、WebDev Arena Legacy、Design Arena 非 Agentic 子榜、Artificial Analysis 模型级 Coding Index。

以下榜单虽以「非编码 / 办公交付」为主,但直接给 agent harness 排名,对 harness 型团队同样有参考价值,故按类型在本页单列而非剔除:DuMateBench(Code 仅 88/200)、Toolathlon(跨应用工具使用,非代码修复)。

相关

信源与口径

数据截至 2026-09-18(榜单横向地图与可信度分层部分);2026-09-22 补充 Multi-SWE-bench 与 DuMateBench 两条线(可提交性、分数与风险)。优先采用官方榜、官方论文与官方仓库;第三方聚合数据已单独标注。榜单变化快,本页是 2026-09 时点快照,引用单个数字前请回源确认最新版本与日期。