golden set골든 세트
AI 모델이나 agent의 출력을 평가하려고 사람이 검토해 확정한 입력과 기대 출력을 모은 기준 데이터 묶음이다.
기사 1편
최근 언급 골든 세트(golden set)는 AI 모델이나 agent의 출력을 평가하는 기준으로 쓰는 데이터 묶음이다. 대표적인 질문이나 입력과 함께, 사람이 검토해 정답으로 확정한 기대 출력을 담는다. golden dataset이라고도 한다.
머신러닝과 대규모 언어 모델(LLM) 평가에서 모델, prompt, 설정을 바꿀 때마다 같은 골든 세트로 결과를 비교해 품질 저하를 확인하는 데 쓰인다. 공개된 표준 평가 데이터인 benchmark와 달리, 조직이 자기 업무와 요구 사항에 맞춰 직접 만드는 경우가 많다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.