HumanEval

HumanEvalは、OpenAIが公開した、AIモデルのPythonコード生成能力を評価するベンチマークである。

記事1本
最終言及

HumanEvalは、OpenAIが2021年に公開したベンチマークで、関数の説明を与えてモデルにPythonの関数を書かせ、単体テストに合格するかどうかで正誤を判定する。164問で構成され、大規模言語モデルのコーディング能力を比べる指標として広く使われている。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

HumanEval Remix 100問 75問合格(75%)、5問は無回答


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。