黄金测试集golden set
为评估AI模型或智能体的输出而整理的一组输入及经人工确认的预期输出,用作评估基准。
1篇文章
最近提及 黄金测试集(golden set)是用作评估AI模型或智能体输出基准的数据集合,由具有代表性的问题或输入以及经人工审核确认的预期输出组成,也称黄金数据集。
在机器学习和大语言模型评估中,团队每次更换模型、提示词或配置时,都会用同一个黄金测试集比较结果,以发现质量退化。与公开的标准基准测试不同,黄金测试集通常由组织根据自身业务和需求自行构建。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。