Humanity's Last Exam人類最後の試験
Humanity's Last Examは、複数の専門分野の難問を用いてAIモデルの知識と推論能力を測るベンチマークである。
記事2本
最終言及 Humanity's Last Exam(HLE)は、さまざまな専門分野の難問を使ってAIモデルの知識と推論能力を評価するベンチマークである。Center for AI SafetyとScale AIが専門家らと開発し、2025年に公開した。
既存のベンチマークでは上位モデルの得点が高くなり差がつきにくくなったことから、難度の高い問題で構成されている。結果は外部ツールの使用可否など条件別に示されることもある。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
ツール使用ありのHumanity's Last Exam 67.7% 65.6% 57.2%