本目录存放打榜相关的实操信息:某个榜怎么跑、怎么提交、要交什么材料、花多少钱、哪些坑不能踩。

一榜一页,新榜出现时在本目录新增独立页面,不要往已有页面里塞。

收录标准

只有满足以下条件的榜单才在本目录建页:

  • 有明确的提交路径(自助提交或已知的收录渠道)
  • 有可核验的评测协议(能查到数据集、判分方式、harness 约束)
  • 有实际打榜价值(对外可引用,或能作为内部技术验证基线)

只用来「读分数」的榜单不进本目录,见 leaderboards。

榜单清单

榜单页面能否自助提交成本量级状态
SWE-bench-Liveswe-bench-live能(PR 提交)7k开放,推荐首选(抗污染 + 轨迹核验)
Multi-SWE-benchmulti-swe-bench能(PR 到 experiments,可按语言)单语言 600 / 全量 8k开放;无防污染,作补充证据
DuMateBenchdumatebench能(Harbor --upload --public + manifest PR)10k(1000+ rollout)开放;国内唯一 harness 型自助榜
Terminal-Bench 4.0terminal-bench不能(社区提交已关闭)9,604只能自证,等通道开放

打榜配套仓库(opensources/)

不是榜单,是打榜链路上游/中游的现成实现,统一放在本目录的 opensources/ 子目录下,与一榜一页的榜单页分开。按在链路里的位置分三类:

① 基准工具链(榜单背后的项目本体)

项目说明
swe-bench-livemicrosoft/SWE-bench-Live 本体:造题流水线(爬仓库→筛仓库→抓 issue-PR→LLM 判质→建环境→验证)+ 评估器;本地自测 patch 用的就是它

② 环境 / 任务生成(跑 agent 之前)

项目说明
repolaunchRepoLaunch:给 repo + commit 自动造 Docker 环境、重建/测试命令与用例级 parser;SBL 的题目环境即由它生成

③ harness 接入(怎么把 agent 接上榜单)

Harness说明
swe-agent-for-evalSWE-agent 的评测 fork;本地 JSONL 数据源 + 合规禁 git prompt + 内联 SWE-ReX

同作者另有 OpenHands / ClaudeCode 两条线(njukenanli/OpenHands-for-eval、njukenanli/ClaudeCode-for-eval),思路一致,见 swe-agent-for-eval 页内说明。

相邻目录分工

目录存什么
本目录打榜实操:怎么跑、怎么提交、成本、坑
submission/opensources/打榜配套仓库:基准工具链 + 环境/任务生成 + harness 接入
llms/benchmarks/评测集本身是什么:任务形态、判分方法论
llms/leaderboards/分数快照:谁排第几、当前榜首
coding-agent-leaderboards榜单横向地图与可信度分层
coding-agent-leaderboard-selection选型决策:该打哪个榜

新增榜单页模板

在本目录新建 <榜单名>.md,按以下骨架填写:

---
title: <榜单名> 打榜指南
created: YYYY-MM-DD
updated: YYYY-MM-DD
type: query
tags: [ai-ml, benchmark, ecosystem]
sources:
  - <官方页>
mastery_target: familiar
mastery_current: aware
---
 
# <榜单名> 打榜指南
 
## 是什么
(定位 / 维护方 / 任务形态 / 规模 / 指标 / 版本口径)
 
## 怎么打
(环境安装 → 跑评测 → 接入自研 agent → 提交步骤 → 必填材料 → 核验机制)
 
## 成本
(分档给出题量、耗时、美元区间,标明官方口径还是推断)
 
## 常见坑
(编号列出,每条可操作)
 
## 相关
(至少 2 个 wikilink)
 
## 信源

建页后必须同步:index.md 条目与计数、log.md 记录、以及本页的「榜单清单」表。

相关