LLM-as-a-judge

LLM-as-a-judge是让大语言模型按照既定标准为AI输出打分的评估方法。

1篇文章
最近提及

LLM-as-a-judge是一种把大语言模型用作评估者、为其他模型或AI应用的回复打分的方法。评估模型按照既定标准给出分数或通过与否等判定,也可以用自然语言说明判定理由。

这种方法用于自动评估数量庞大、难以由人逐条审阅的输出,也用于判断没有唯一正确答案的回复在准确性、忠实度和安全性等方面的质量。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

2025年的标准做法是LLM-as-a-judge评估,即eval:由语言模型按照既定标准为每条追踪记录打分,同时给出判定结果(如分数或通过与否的标记)和说明问题所在的文字解释。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。