黄金测试集golden set

为评估AI模型或智能体的输出而整理的一组输入及经人工确认的预期输出,用作评估基准。

1篇文章
最近提及

黄金测试集(golden set)是用作评估AI模型或智能体输出基准的数据集合,由具有代表性的问题或输入以及经人工审核确认的预期输出组成,也称黄金数据集。

在机器学习和大语言模型评估中,团队每次更换模型、提示词或配置时,都会用同一个黄金测试集比较结果,以发现质量退化。与公开的标准基准测试不同,黄金测试集通常由组织根据自身业务和需求自行构建。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

评估: 用黄金测试集测试智能体,以检查其行为。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。