ゴールデンセットgolden set

AIモデルやエージェントの出力を評価するため、人が確認した入力と期待される出力を集めた基準データのセット。

記事1本
最終言及

ゴールデンセット(golden set)は、AIモデルやエージェントの出力を評価する基準として用いるデータの集まりである。代表的な質問や入力と、人が確認して正解と定めた期待出力を組にして収める。ゴールデンデータセットとも呼ばれる。

機械学習や大規模言語モデル(LLM)の評価では、モデルやプロンプト、設定を変更するたびに同じゴールデンセットで結果を比べ、品質の低下を確かめるために使われる。公開された標準的な評価データであるベンチマークとは異なり、組織が自らの業務や要件に合わせて作成することが多い。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

評価: 信頼できる質問と期待される回答を厳選して集めたゴールデンセットでエージェントをテストし、その挙動を確認する。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。