eval
eval是用既定任务和评分标准衡量AI模型或AI智能体表现的评估,也指这类评估的集合。
1篇文章
最近提及 eval是evaluation的缩写,指让AI模型或AI智能体完成既定任务,并对结果打分,以数值衡量其表现的评估,也可指由许多此类任务组成的评估集合。
在AI开发中,每当更换模型、提示词或智能体配置时,团队都会重新运行同一套eval比较分数,以确认是否有所改进,并分析失败的任务以找出需要修正之处。与公开的标准化基准测试不同,eval往往是针对特定产品或业务自行构建的。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。