评测口径说明见 codeforces。本页只放分数:各模型竞赛编程能力强度(注意:均为报告方口径,协议不一)。

进展时间线(均为报告方口径)

时间模型CF Rating / 百分位来源与备注
2023-12AlphaCode 2≈人类前 15%DeepMind 模拟参赛估计
2024-12o189 百分位(内部评测 ~1791)OpenAI 发布材料
2025-01DeepSeek R12029(超 96.3% 人类)DeepSeek 技术报告;同报告 o1-1217 为 2061
2025-01o3-mini (high)2037OpenAI,CodeforcesEval
2025-08GPT-5 (high)2721OpenAI 报告;第三方复测另有 2537 口径
2025-10DeepSeek V3.2 / Speciale2386 / 2701DeepSeek(Speciale 达人类大师级)
2025-11Gemini 3 Pro3455(人类 Top 10,仅 7 人能赢)Google 模型卡
2026-04DeepSeek V4 / GPT-5.43206(并列,人类现役第 23 位)DeepSeek 发布口径

注意矛盾点:Gemini 3.0 Pro(2025-11)3455 > GPT-5.4(2026-04)3206,时间上”后来者反而更低”——这正是协议差异(采样次数/场次/判题口径)大于能力差异的典型例子。读任何 CF rating 先问协议。

衍生评测集当前榜首

评测集榜首分数备注
LiveCodeBench ProGemini 3 Deep Think81.6%其后 Gemini 3.1 Pro Preview 75.5%、GPT-5.2-high 53.1%(断崖明显)
LiveCodeBench v6Sakana Fugu-Ultra93.2%benchlm 快照,16 模型

分数观察

  1. rating 是协议敏感指标:同一模型不同采样/提交协议差几百分;厂商自选口径数字当宣传看,横向比要用同一评测框架
  2. 竞赛编程 ≠ 软件工程:CF rating 与 SWE-bench/Terminal-Bench 排名不迁移——它测算法设计与深度推理,不是工程交付
  3. 头部已进入人类 Legendary GM 区间(3455),该指标对 frontier 的区分度在下降,各家开始转向 LiveCodeBench Pro / 奥赛级题目