一句话定位:最大竞技编程平台的 Elo rating 体系,被直接拿来当 LLM 算法竞赛能力的标尺——模型打真实比赛、和数百万人类选手同榜排名,分数自带”人类相对水平”解释力(也是各家发布会最爱引用的编程指标之一)。

为什么值得关注

  • 人类相对刻度:与人类共用同一套 Elo 体系,分数直接翻译成人话——1900 Candidate Master、2100 Master、2400 Grandmaster、2600 International GM、3000+ Legendary GM;“模型达到人类前 0.01%“这类表述都靠它
  • 天然防污染的活评测:比赛持续出新题,让模型打 live contest 就避开了训练集泄露(对比静态题库)
  • 判定硬核:平台测试数据自动判题,AC 就是 AC,没有 judge 模型的主观空间
  • 平台背景:2010 年由 Mikhail Mirzayanov 创立,全球注册选手数百万,题目覆盖算法设计/数据结构/数学建模,是 ICPC 训练主阵地

两种评测形态

形态 A:打比赛算 rating(厂商发布会口径)

模型在真实(或模拟的)Codeforces 比赛中提交,按同一 Elo 公式计算 rating。各家协议不同(提交次数、self-consistency 采样数、比赛场次选择),跨厂商数字不可直接比。

形态 B:静态题集评测(可复现口径)

从 CF 历史题抽取固定题集:OpenAI 的 CodeforcesEval(o3-mini 报告使用)、LiveCodeBench 系列(按时间窗截题防污染)、以及各类学术衍生集。

排行榜

各模型 rating 进展时间线见 codeforces(AlphaCode 2 ≈人类前 15% → Gemini 3 Pro 3455 人类 Top 10;均为报告方口径,读前先问协议)。

Codeforces 衍生评测集

评测集说明
CodeforcesEvalOpenAI 内部评测集,o3-mini 报告使用(rating 口径出处之一)
LiveCodeBenchUC Berkeley/MIT/Cornell 等出品,持续收集 CF+AtCoder+LeetCode 训练截止后的新题,按时间窗分榜防污染;v6 含 1000+ 题
LiveCodeBench Pro更难竞赛题族(CF+ICPC+IOI),难度感知报告;当前榜首 Gemini 3 Deep Think 81.6% > Gemini 3.1 Pro Preview 75.5% > GPT-5.2-high 53.1%(断崖明显)
ProBench / Codehacks学术侧:竞赛编程基准、对抗性测试用例集(官方测试数据不公开,合成测试有误报/漏报问题)
open-r1/codeforcesCF 题目+提交记录开源镜像(HuggingFace),可自建验证器

关键观察

  1. 竞赛编程 ≠ 软件工程:CF rating 与 SWE-bench/Terminal-Bench 排名不迁移(与 vibe-code-bench 的结论一致)——它测的是算法设计与深度推理,不是工程交付
  2. 防污染有结构性优势:live contest + 持续新题是静态题库做不到的;但老题仍可能进训练集,官方测试数据不公开导致第三方复现难

局限性

  • 协议不统一、rating 计算场次少时方差大
  • 测算法竞赛能力,不代表 agent/工程/长时域任务能力
  • 厂商自评为主,独立第三方 live-rating 评测少

资源

相关页面

  • codeforces — 本口径榜单快照(rating 进展时间线)
  • swe-bench-verified — 修真实仓库 bug 基准(工程向,与竞赛编程不迁移)
  • vibe-code-bench — 从零建应用基准(同样观察到跨榜排名不迁移)
  • terminal-bench — 终端环境任务基准
  • humanitys-last-exam — 知识前沿闭卷考(同系列评测集)
  • toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
  • apex-shortlist — MathArena Apex:极限竞赛数学题集(数学方向的竞赛线)