评测集定义与方法论见 humanitys-last-exam。本页只放分数。
⚠️ HLE 没有唯一权威数字,至少三套口径并存——引用任何 HLE 分数必须先带协议说明。
口径 A:带工具 agent 全集(benchlm.ai,2026-08-13 更新,48 模型)
| # | 模型 | 厂商 | 权重 | 分数 |
|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 闭源 | 64.7% |
| 2 | Claude Mythos 5 | Anthropic | 闭源 | 64.5% |
| 3 | Muse Spark 1.1 | Meta | 闭源 | 62.1% |
| 4 | GPT-5.4 Pro | OpenAI | 闭源 | 58.7% |
| 5 | Claude Opus 4.8 | Anthropic | 闭源 | 57.9% |
| 6 | Claude Sonnet 5 | Anthropic | 闭源 | 57.4% |
| 7 | GPT-5.5 Pro | OpenAI | 闭源 | 57.2% |
| 8 | Kimi K3 | Moonshot AI | 闭源 | 56.0% |
| 9 | GLM-5.2 | Z.AI | 开源 | 54.7% |
| 10 | Claude Opus 4.7 (Adaptive) | Anthropic | 闭源 | 54.7% |
| 11-15 | Opus 4.6 53.0% · GLM-5.1 52.3% · GPT-5.5 52.2% · GPT-5.4 52.1% · GLM-5 50.4% | |||
| 16-20 | Muse Spark 50.4% · Sonnet 4.6 49.0% · MiMo-V2.5-Pro 48.0% · Inkling-Small 47.8% · Agents-A1 47.6% |
(开源权重最佳:GLM-5.2 54.7%,第 9;尾部 Gemini 2.5 Pro 18.8%、DeepSeek V4 Flash 8.1%)
口径 B:闭卷/不带工具(Artificial Analysis 方法)
Gemini 3.1 Pro Preview 44.7% > GPT-5.4 41.6% > GPT-5.3 Codex 39.9%(2026-04 快照,261 模型);Claude Fable 5 在 AA 测试中 53.3%(2026-07,含把 9% 任务路由给 Opus 4.8 的行为)
口径 C:带工具全集历史 SOTA(zoom-ai HF 空间,2500 题全量)
Claude Mythos Preview 64.7(2026-04)→ Claude Fable 5 / Mythos 5 64.5(2026-06)→ GPT-5.4 Pro 58.7 → Muse Spark (Contemplating) 58.4
分数观察
- 带工具 vs 闭卷差 ~20 分;精确匹配 vs LLM judge 判分又差一截——这就是 zoom-ai 榜单空间吐槽”问三大模型 HLE SOTA 是多少,全都答错”的原因
- 进展曲线:2025-01 发布 ~8% → 2026-03 GPT-5.4 Pro 58.7% → 2026-04 起 64.7%;顶部 2.6 分内聚集(frontier 段接近饱和,整体仍有大量 headroom)
- HLE-Verified 口径更高:修复噪声题后模型平均高 7-10pp(坏题子集高 30-40pp),见评测集页