一句话定位:coding agent 领域事实标准的评测集——从 SWE-bench 2294 道真实 GitHub issue 里经专业工程师人工筛出的 500 道高质量子集(2024-08 由 SWE-bench 团队与 OpenAI 联合发布),现已成为衡量模型”修真实仓库 bug”能力的主榜单。
为什么值得关注
- 事实标准:几乎所有主流模型/harness 发布都报 Verified 分数,横向可比性最好
- 人工质检过:原始 SWE-bench 约 1/3 题目存在问题描述不自洽或测试缺陷,Verified 逐条人工验证后保留 500 道”题面可解 + gold patch 真能解题 + 测试合理”的样本
- 公开透明:数据集公开(HuggingFace)、评测 Docker 化可自跑、榜单提交机制开放,与 vibe-code-bench 这类专有评测集形成对照
- 率先推出 Bash-Only 同 harness 视图(所有模型跑在同一个 100 行 Python 的 mini-SWE-agent 里),把”模型能力”和”harness 工程”分开衡量
评测集构成
| 项 | 说明 |
|---|---|
| 任务形态 | 真实 GitHub issue:给定 repo 某 commit 状态 + issue 文本,模型产出 patch(unified diff) |
| 来源 | SWE-bench(2294 实例,12 个 Python 仓库的真实 merged issue),ICLR 2024,arXiv:2310.06770 |
| 筛选 | OpenAI 招募的职业软件工程师逐条评审:题面仅凭给定信息可解、gold patch 是真实解法、配套测试合理;筛出 500 条 |
| 评分 | 沙箱(Docker)内应用 patch 跑测试:FAIL_TO_PASS(原来挂的测试要过)+ PASS_TO_PASS(原来过的不能挂);% Resolved = 通过实例占比 |
| 人类基线 | 专家解决率约 92%(发布时数据),当前最强模型 ~79%,仍有差距 |
SWE-bench 家族(同站点):SWE-bench Full(2294)、Verified(500)、Lite(300,低成本子集)、Multilingual(300 题 / 9 语言 / 42 仓库)、Multimodal(517 题,含视觉信息的 issue)。周边生态:SWE-agent、mini-SWE-agent、SWE-ReX、SWE-smith(合成训练数据)、CodeClash、ProgramBench。
排行榜
模型分数见 swe-bench-verified(含 Verified 总榜与 Bash-Only 同 harness 视图,榜首 Claude 4.5 Opus 79.2%)。
时间线
| 时间 | 事件 |
|---|---|
| 2023-10 | SWE-bench 论文(arXiv:2310.06770,ICLR 2024) |
| 2024-03 | SWE-agent 发布(12.47%);SWE-bench Lite |
| 2024-06 | 评测 Docker 化 |
| 2024-08 | SWE-bench Verified(联合 OpenAI 发布) |
| 2024-10 | SWE-bench Multimodal |
| 2025-05 | SWE-smith(合成 agent 训练数据) |
| 2025-07 | mini-SWE-agent:100 行 Python 拿到 65% |
| 2025-11 / 2026-05 | CodeClash / ProgramBench(面向目标导向开发、从零写软件的新评测) |
局限性
- Python-only(Multilingual 版才覆盖 9 语言);任务以修 bug/加小功能为主,不覆盖从零建应用(见 vibe-code-bench)
- 总榜 harness 不统一,跨条目比较需看 agent 列
- 污染风险 + 公开 gold patch 泄露风险
- 单次评测成本不低(bash-only 视图正是为降低评测成本设计)
资源
- 官网与榜单:https://www.swebench.com/(Verified/Multilingual/Multimodal/Lite/Full/Bash-Only 六榜,支持按实例级对比)
- 发布公告(OpenAI):https://openai.com/index/introducing-swe-bench-verified/
- 原始论文:https://arxiv.org/abs/2310.06770
- 数据:HuggingFace
princeton-nlp/SWE-bench_Verified
相关页面
- swe-bench-verified — 本基准榜单快照
- vibe-code-bench — Vibe Code Bench:从零建应用基准(明确指出其排名与 SWE-bench Verified 不迁移)
- 2605.10912_wildclaw-bench — WildClawBench:长时域真实任务 Agent 基准
- meta-harness — Terminal-Bench 榜首的 Harness 自动优化框架(harness 工程维度的延伸)
- terminal-bench — Terminal-Bench:终端环境长时域任务基准(另一个主战场)
- humanitys-last-exam — HLE:知识前沿闭卷考(同系列评测集)
- codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
- toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
- deepswe — DeepSWE:原创长时域 SWE 基准(同思路的防饱和新作)
- superclue — SuperCLUE:中文向综合测评体系(其 SuperCLUE-SWE 对应中文软件工程维度)