评测集定义与 Shortlist 定义考证见 apex-shortlist。本页只放分数。

MathArena Apex 原始结果(2025-08 发布,16 runs/模型)

最强 Qwen3-A22B-2507-Think 仅 5.2%(7/16 集中在最易的第 1 题);第 9-12 题所有模型 0 解。官方提示:题目按”模型做不出”筛选,不要从该表排名下结论。

DeepSeek V4 报告口径(Pass@1,2026-04 预览发布)

模型ApexApex Shortlist
Gemini 3.1 Pro (High)60.989.1
GPT-5.4 (xHigh)54.178.1
Claude Opus 4.6 (Max)34.585.9
DeepSeek V4-Pro-Max38.390.2(全场第一)
GLM-5.1 (Max)24.075.5
Kimi K2.611.572.4

(2026-04 预览版到 2026-08 正式版:V4-Pro 的 Apex 从 1.0 → 38.3,Shortlist 从 9.3 → 90.2)

分数观察

  1. 主集难度快速衰减:2025-08 发布时最强仅 5.2%,到 2026-04 DeepSeek 测时 Apex 主集最高已 60.9%——题目陆续被攻克/集合扩充
  2. Shortlist 比主集更大更易(72-90% vs 11-61%),口径未公开,跨表不可比
  3. 同期参考:V4-Pro-Max HMMT 2026 95.2、IMOAnswerBench 89.8、Putnam-2025 满分 120/120
  4. 定性发现(MathArena 博客):各模型常犯同样的错(最常见错误答案占 50%+ 尝试)、“懒且固执”(锁定错误直觉后全力自证)、只有 GPT-5 偶尔承认”给不出严格证明”