ゴールデンセットgolden set
AIモデルやエージェントの出力を評価するため、人が確認した入力と期待される出力を集めた基準データのセット。
記事1本
最終言及 ゴールデンセット(golden set)は、AIモデルやエージェントの出力を評価する基準として用いるデータの集まりである。代表的な質問や入力と、人が確認して正解と定めた期待出力を組にして収める。ゴールデンデータセットとも呼ばれる。
機械学習や大規模言語モデル(LLM)の評価では、モデルやプロンプト、設定を変更するたびに同じゴールデンセットで結果を比べ、品質の低下を確かめるために使われる。公開された標準的な評価データであるベンチマークとは異なり、組織が自らの業務や要件に合わせて作成することが多い。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。