HumanEval
HumanEvalは、OpenAIが公開した、AIモデルのPythonコード生成能力を評価するベンチマークである。
記事1本
最終言及 HumanEvalは、OpenAIが2021年に公開したベンチマークで、関数の説明を与えてモデルにPythonの関数を書かせ、単体テストに合格するかどうかで正誤を判定する。164問で構成され、大規模言語モデルのコーディング能力を比べる指標として広く使われている。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。