评测集定义与 Shortlist 定义考证见 apex-shortlist。本页只放分数。
MathArena Apex 原始结果(2025-08 发布,16 runs/模型)
最强 Qwen3-A22B-2507-Think 仅 5.2%(7/16 集中在最易的第 1 题);第 9-12 题所有模型 0 解。官方提示:题目按”模型做不出”筛选,不要从该表排名下结论。
DeepSeek V4 报告口径(Pass@1,2026-04 预览发布)
| 模型 | Apex | Apex Shortlist |
|---|---|---|
| Gemini 3.1 Pro (High) | 60.9 | 89.1 |
| GPT-5.4 (xHigh) | 54.1 | 78.1 |
| Claude Opus 4.6 (Max) | 34.5 | 85.9 |
| DeepSeek V4-Pro-Max | 38.3 | 90.2(全场第一) |
| GLM-5.1 (Max) | 24.0 | 75.5 |
| Kimi K2.6 | 11.5 | 72.4 |
(2026-04 预览版到 2026-08 正式版:V4-Pro 的 Apex 从 1.0 → 38.3,Shortlist 从 9.3 → 90.2)
分数观察
- 主集难度快速衰减:2025-08 发布时最强仅 5.2%,到 2026-04 DeepSeek 测时 Apex 主集最高已 60.9%——题目陆续被攻克/集合扩充
- Shortlist 比主集更大更易(72-90% vs 11-61%),口径未公开,跨表不可比
- 同期参考:V4-Pro-Max HMMT 2026 95.2、IMOAnswerBench 89.8、Putnam-2025 满分 120/120
- 定性发现(MathArena 博客):各模型常犯同样的错(最常见错误答案占 50%+ 尝试)、“懒且固执”(锁定错误直觉后全力自证)、只有 GPT-5 偶尔承认”给不出严格证明”