golden set골든 세트

AI 모델이나 agent의 출력을 평가하려고 사람이 검토해 확정한 입력과 기대 출력을 모은 기준 데이터 묶음이다.

기사 1편
최근 언급

골든 세트(golden set)는 AI 모델이나 agent의 출력을 평가하는 기준으로 쓰는 데이터 묶음이다. 대표적인 질문이나 입력과 함께, 사람이 검토해 정답으로 확정한 기대 출력을 담는다. golden dataset이라고도 한다.

머신러닝과 대규모 언어 모델(LLM) 평가에서 모델, prompt, 설정을 바꿀 때마다 같은 골든 세트로 결과를 비교해 품질 저하를 확인하는 데 쓰인다. 공개된 표준 평가 데이터인 benchmark와 달리, 조직이 자기 업무와 요구 사항에 맞춰 직접 만드는 경우가 많다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

agent를 작성하고 실행한 뒤 시험하는 기본 절차에는 신뢰할 수 있는 평가 질문과 기대 답변을 모은 golden set(평가용 기준 문항과 답변 묶음)이 쓰일 수 있습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.