一句话定位:coding agent 领域事实标准的评测集——从 SWE-bench 2294 道真实 GitHub issue 里经专业工程师人工筛出的 500 道高质量子集(2024-08 由 SWE-bench 团队与 OpenAI 联合发布),现已成为衡量模型”修真实仓库 bug”能力的主榜单。

为什么值得关注

  • 事实标准:几乎所有主流模型/harness 发布都报 Verified 分数,横向可比性最好
  • 人工质检过:原始 SWE-bench 约 1/3 题目存在问题描述不自洽或测试缺陷,Verified 逐条人工验证后保留 500 道”题面可解 + gold patch 真能解题 + 测试合理”的样本
  • 公开透明:数据集公开(HuggingFace)、评测 Docker 化可自跑、榜单提交机制开放,与 vibe-code-bench 这类专有评测集形成对照
  • 率先推出 Bash-Only 同 harness 视图(所有模型跑在同一个 100 行 Python 的 mini-SWE-agent 里),把”模型能力”和”harness 工程”分开衡量

评测集构成

项说明
任务形态真实 GitHub issue:给定 repo 某 commit 状态 + issue 文本,模型产出 patch(unified diff)
来源SWE-bench(2294 实例,12 个 Python 仓库的真实 merged issue),ICLR 2024,arXiv:2310.06770
筛选OpenAI 招募的职业软件工程师逐条评审:题面仅凭给定信息可解、gold patch 是真实解法、配套测试合理;筛出 500 条
评分沙箱(Docker)内应用 patch 跑测试:FAIL_TO_PASS(原来挂的测试要过)+ PASS_TO_PASS(原来过的不能挂);% Resolved = 通过实例占比
人类基线专家解决率约 92%(发布时数据),当前最强模型 ~79%,仍有差距

SWE-bench 家族(同站点):SWE-bench Full(2294)、Verified(500)、Lite(300,低成本子集)、Multilingual(300 题 / 9 语言 / 42 仓库)、Multimodal(517 题,含视觉信息的 issue)。周边生态:SWE-agent、mini-SWE-agent、SWE-ReX、SWE-smith(合成训练数据)、CodeClash、ProgramBench。

排行榜

模型分数见 swe-bench-verified(含 Verified 总榜与 Bash-Only 同 harness 视图,榜首 Claude 4.5 Opus 79.2%)。

时间线

时间事件
2023-10SWE-bench 论文(arXiv:2310.06770,ICLR 2024)
2024-03SWE-agent 发布(12.47%);SWE-bench Lite
2024-06评测 Docker 化
2024-08SWE-bench Verified(联合 OpenAI 发布)
2024-10SWE-bench Multimodal
2025-05SWE-smith(合成 agent 训练数据)
2025-07mini-SWE-agent:100 行 Python 拿到 65%
2025-11 / 2026-05CodeClash / ProgramBench(面向目标导向开发、从零写软件的新评测)

局限性

  • Python-only(Multilingual 版才覆盖 9 语言);任务以修 bug/加小功能为主,不覆盖从零建应用(见 vibe-code-bench)
  • 总榜 harness 不统一,跨条目比较需看 agent 列
  • 污染风险 + 公开 gold patch 泄露风险
  • 单次评测成本不低(bash-only 视图正是为降低评测成本设计)

资源

相关页面

  • swe-bench-verified — 本基准榜单快照
  • vibe-code-bench — Vibe Code Bench:从零建应用基准(明确指出其排名与 SWE-bench Verified 不迁移)
  • 2605.10912_wildclaw-bench — WildClawBench:长时域真实任务 Agent 基准
  • meta-harness — Terminal-Bench 榜首的 Harness 自动优化框架(harness 工程维度的延伸)
  • terminal-bench — Terminal-Bench:终端环境长时域任务基准(另一个主战场)
  • humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
  • codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
  • toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
  • deepswe — DeepSWE:原创长时域 SWE 基准(同思路的防饱和新作)
  • superclue — SuperCLUE:中文向综合测评体系(其 SuperCLUE-SWE 对应中文软件工程维度)