eval

eval是用既定任务和评分标准衡量AI模型或AI智能体表现的评估,也指这类评估的集合。

1篇文章
最近提及

eval是evaluation的缩写,指让AI模型或AI智能体完成既定任务,并对结果打分,以数值衡量其表现的评估,也可指由许多此类任务组成的评估集合。

在AI开发中,每当更换模型、提示词或智能体配置时,团队都会重新运行同一套eval比较分数,以确认是否有所改进,并分析失败的任务以找出需要修正之处。与公开的标准化基准测试不同,eval往往是针对特定产品或业务自行构建的。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

2025年的标准做法是LLM-as-a-judge评估,即eval:由语言模型按照既定标准为每条追踪记录打分,同时给出判定结果(如分数或通过与否的标记)和说明问题所在的文字解释。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。