Humanity's Last Exam人類最後の試験

Humanity's Last Examは、複数の専門分野の難問を用いてAIモデルの知識と推論能力を測るベンチマークである。

記事2本
最終言及

Humanity's Last Exam(HLE)は、さまざまな専門分野の難問を使ってAIモデルの知識と推論能力を評価するベンチマークである。Center for AI SafetyとScale AIが専門家らと開発し、2025年に公開した。

既存のベンチマークでは上位モデルの得点が高くなり差がつきにくくなったことから、難度の高い問題で構成されている。結果は外部ツールの使用可否など条件別に示されることもある。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Haiku 5.5はほかに、Humanity's Last Examでツールなし45.9%、ツールあり57.4%、エージェント型コーディングのテストTerminal-Bench 4.0で39.2%、FrontierCode 1.1と視覚推論のテストChartographyでいずれも46.4%を記録しています。

ツール使用ありのHumanity's Last Exam 67.7% 65.6% 57.2%


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。