一句话定位:CAIS(Center for AI Safety)× Scale AI 出品的”人类知识前沿终极闭卷考”——2,500 道由全球学科专家命制、连专家都觉得难的研究生级以上题目(多选+简答、含多模态),设计初衷是成为”最后一个”广覆盖闭卷学术基准,因为命题时要求专家出”当前 AI 还答不上的题”。
为什么值得关注
- 难度天花板设计:MMLU 等已被刷到 90%+ 饱和,HLE 专门收集 frontier 模型答不出的题,2025-01 发布时最强模型仅个位数百分比(~8%),一年半后到 ~65%,是观察”知识+推理前沿”进展的主刻度
- 覆盖几十个学科:数学占比最大,其余物理/化学/生物/计算机/哲学/历史/音乐/古典学/经济学等;不少题带图像(多模态)
- 自动可判分:每题有明确无歧义、可快速验证的答案,且”不能靠检索直接搜到”
- 口径混乱是 HLE 的最大看点:同一模型不同评测协议相差 20+ 分(详见下文),读任何 HLE 数字必须先问清口径
评测集构成
| 项 | 说明 |
|---|---|
| 题量 | 2,500(论文口径;部分第三方追踪站记 3,000,含扩展题) |
| 题型 | 多选题 + 简答题(自动判分:精确匹配或 LLM judge) |
| 命题 | 全球 subject-matter experts 众筹命制,每题有已知唯一解;要求”互联网检索不能快速得出” |
| 发布 | 2025-01 首发(arXiv:2501.14249,持续修订至 2026-07 v11);官方站 lastexam.org(2026-08 抓取时 DNS 无法解析,权威官方榜暂不可达) |
排行榜
模型分数见 humanitys-last-exam(三套口径并存:带工具 agent / 闭卷 AA 方法 / 历史 SOTA,口径差 ~20 分,引用必须带协议说明)。
数据质量争议:HLE-Verified
社区分析发现 HLE 含相当比例噪声题(题面或参考答案有误),会系统性压低分数并扭曲跨模型对比。HLE-Verified(arXiv:2602.13964)做了两阶段验证-修复:
- 668 题通过专家+模型交叉验证(verified)
- 1,143 题经双独立专家修复后认证(revised)
- 689 题存疑,带不确定性标注开放
- 8 个 SOTA 模型复测:HLE-Verified 上平均高 7-10 个百分点,原题有误的子集上高 30-40 个百分点;且”模型越不自信的题越可能是题目本身有错”
局限
- 闭卷学术问答形态,不代表 agent/实操能力(与 swe-bench-verified、terminal-bench 互补);公开题有训练污染风险(官方榜单依赖非公开题);官方站不可达导致权威口径缺位,第三方榜单各说各话
资源
- 论文:Humanity’s Last Exam,https://arxiv.org/abs/2501.14249(v11,2026-07-28)
- HLE-Verified:https://arxiv.org/abs/2602.13964
- 带工具 agent 榜:https://huggingface.co/spaces/zoom-ai/hle-leaderboard
- 每日更新追踪:https://benchlm.ai/benchmarks/hle
- 数据集:HuggingFace
cais/hle;官方站 https://lastexam.org(DNS 异常待恢复)
相关页面
- humanitys-last-exam — 本基准榜单快照(三口径)
- 2606.05405_agents-last-exam — Agents’ Last Exam:同为 CAIS 系的”终极考试”,但考长视野 agent 任务
- swe-bench-verified — 修 GitHub issue 基准(实操向,与 HLE 知识向互补)
- terminal-bench — 终端环境任务基准
- vibe-code-bench — 从零建应用基准
- codeforces — Codeforces rating:竞赛编程口径(同系列评测集)
- toolathlon — Toolathlon:跨应用长程工具使用基准(同系列评测集)
- apex-shortlist — MathArena Apex:极限竞赛数学题集(同为”最后一个基准”设计哲学)