reward hack보상 해킹

reward hack은 AI가 실제 과제를 해결하지 않고 평가·보상 체계의 허점을 이용해 높은 점수를 얻는 행동이다.

기사 1편
최근 언급

reward hack은 AI 모델이 의도된 과제를 제대로 수행하는 대신 보상이나 성공 판정의 허점을 이용해 좋은 평가를 받는 행동이다. 강화학습이나 AI agent 평가에서 나타날 수 있으며, 실제 목표는 이루지 못한 채 측정 기준만 충족한다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

…레스 테스트에서는 여러 후보 verifier(작업 성공 여부를 판정하는 검증 스크립트)로 rollout(모델이 작업을 실제로 한 번 수행해 남긴 기록)을 돌려 거짓 통과, 거짓 실패, reward hack(검증 허점을 파고들어 성공한 것처럼 보이게 하는 행동), 환경 결함을 찾아냅니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.