reward hack보상 해킹
reward hack은 AI가 실제 과제를 해결하지 않고 평가·보상 체계의 허점을 이용해 높은 점수를 얻는 행동이다.
기사 1편
최근 언급 reward hack은 AI 모델이 의도된 과제를 제대로 수행하는 대신 보상이나 성공 판정의 허점을 이용해 좋은 평가를 받는 행동이다. 강화학습이나 AI agent 평가에서 나타날 수 있으며, 실제 목표는 이루지 못한 채 측정 기준만 충족한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.