评测集定义与方法论见 humanitys-last-exam。本页只放分数。

⚠️ HLE 没有唯一权威数字,至少三套口径并存——引用任何 HLE 分数必须先带协议说明。

口径 A:带工具 agent 全集(benchlm.ai,2026-08-13 更新,48 模型)

#模型厂商权重分数
1Claude Opus 5Anthropic闭源64.7%
2Claude Mythos 5Anthropic闭源64.5%
3Muse Spark 1.1Meta闭源62.1%
4GPT-5.4 ProOpenAI闭源58.7%
5Claude Opus 4.8Anthropic闭源57.9%
6Claude Sonnet 5Anthropic闭源57.4%
7GPT-5.5 ProOpenAI闭源57.2%
8Kimi K3Moonshot AI闭源56.0%
9GLM-5.2Z.AI开源54.7%
10Claude Opus 4.7 (Adaptive)Anthropic闭源54.7%
11-15Opus 4.6 53.0% · GLM-5.1 52.3% · GPT-5.5 52.2% · GPT-5.4 52.1% · GLM-5 50.4%
16-20Muse Spark 50.4% · Sonnet 4.6 49.0% · MiMo-V2.5-Pro 48.0% · Inkling-Small 47.8% · Agents-A1 47.6%

(开源权重最佳:GLM-5.2 54.7%,第 9;尾部 Gemini 2.5 Pro 18.8%、DeepSeek V4 Flash 8.1%)

口径 B:闭卷/不带工具(Artificial Analysis 方法)

Gemini 3.1 Pro Preview 44.7% > GPT-5.4 41.6% > GPT-5.3 Codex 39.9%(2026-04 快照,261 模型);Claude Fable 5 在 AA 测试中 53.3%(2026-07,含把 9% 任务路由给 Opus 4.8 的行为)

口径 C:带工具全集历史 SOTA(zoom-ai HF 空间,2500 题全量)

Claude Mythos Preview 64.7(2026-04)→ Claude Fable 5 / Mythos 5 64.5(2026-06)→ GPT-5.4 Pro 58.7 → Muse Spark (Contemplating) 58.4

分数观察

  1. 带工具 vs 闭卷差 ~20 分;精确匹配 vs LLM judge 判分又差一截——这就是 zoom-ai 榜单空间吐槽”问三大模型 HLE SOTA 是多少,全都答错”的原因
  2. 进展曲线:2025-01 发布 ~8% → 2026-03 GPT-5.4 Pro 58.7% → 2026-04 起 64.7%;顶部 2.6 分内聚集(frontier 段接近饱和,整体仍有大量 headroom)
  3. HLE-Verified 口径更高:修复噪声题后模型平均高 7-10pp(坏题子集高 30-40pp),见评测集页