Humanity's Last Exam人类最后的考试

Humanity's Last Exam 是以多学科专家级难题评估 AI 模型知识与推理能力的基准测试。

2篇文章
最近提及

Humanity's Last Exam(HLE)是一项基准测试,通过多个专业领域的高难度问题评估 AI 模型的知识与推理能力。它由 Center for AI Safety、Scale AI 与各领域专家共同开发,于 2025 年发布。

由于领先模型在既有基准测试上的得分已普遍很高、难以拉开差距,该测试采用高难度题目构成。其成绩有时会按是否允许使用外部工具等条件分别列出。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

Haiku 5.5在Humanity's Last Exam上不使用工具得分45.9%,使用工具得分57.4%;在智能体编程测试Terminal-Bench 4.0上得分39.2%;在FrontierCode 1.1和视觉推理测试Chartography上均为46.4%。

Humanity's Last Exam with tools 67.7% 65.6% 57.2%


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。