LLM-as-a-judge

大規模言語モデルに、定めた基準でAIの出力を採点させる評価手法。

記事1本
最終言及

LLM-as-a-judgeは、大規模言語モデルを評価者として使い、別のモデルやAIアプリケーションの応答を採点する手法である。評価用のモデルは定められた基準に従ってスコアや合否といった判定を下し、その理由を自然言語で説明することもある。

人が1件ずつ確認するのが難しい大量の出力を自動で評価するのに使われ、正解が一つに決まらない回答の正確性、忠実性、安全性などの品質判断に活用される。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

2025年の標準的な答えは、LLM-as-a-judgeによる評価、いわゆるevalでした。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。