Humanity's Last Exam人类最后的考试
Humanity's Last Exam 是以多学科专家级难题评估 AI 模型知识与推理能力的基准测试。
2篇文章
最近提及 Humanity's Last Exam(HLE)是一项基准测试,通过多个专业领域的高难度问题评估 AI 模型的知识与推理能力。它由 Center for AI Safety、Scale AI 与各领域专家共同开发,于 2025 年发布。
由于领先模型在既有基准测试上的得分已普遍很高、难以拉开差距,该测试采用高难度题目构成。其成绩有时会按是否允许使用外部工具等条件分别列出。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
Humanity's Last Exam with tools 67.7% 65.6% 57.2%