reward misspecification보상 명세 오류
reward misspecification은 AI 학습의 보상 지표가 실제 목표를 제대로 반영하지 못하는 문제다.
기사 1편
최근 언급 reward misspecification(보상 명세 오류)은 강화학습과 AI 정렬에서 보상 함수나 평가 지표가 설계자의 실제 목표를 정확히 나타내지 못하는 문제다. 모델이 지표상으로는 높은 점수를 얻어도 의도한 결과와 어긋날 수 있다. 지표 자체의 설계 문제라는 점에서, 주어진 지표의 허점을 이용하는 reward hacking(보상 지표의 허점을 이용해 점수를 높이는 행동)과 구별된다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.