LLM-as-a-judge
LLM-as-a-judge是让大语言模型按照既定标准为AI输出打分的评估方法。
1篇文章
最近提及 LLM-as-a-judge是一种把大语言模型用作评估者、为其他模型或AI应用的回复打分的方法。评估模型按照既定标准给出分数或通过与否等判定,也可以用自然语言说明判定理由。
这种方法用于自动评估数量庞大、难以由人逐条审阅的输出,也用于判断没有唯一正确答案的回复在准确性、忠实度和安全性等方面的质量。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。