GRPO그룹 상대 정책 최적화
GRPO는 같은 입력에 대한 여러 답변의 보상을 서로 비교해 AI 모델을 개선하는 강화학습 알고리즘이다.
기사 1편
최근 언급 GRPO(Group Relative Policy Optimization, 그룹 상대 정책 최적화)는 같은 prompt(모델에 주는 입력)에 대한 여러 답변을 생성하고, 그룹 안에서 보상을 비교해 모델의 응답 방식을 개선하는 강화학습 알고리즘이다. DeepSeek가 2024년 DeepSeekMath 논문에서 제안했다. PPO와 달리 별도의 가치 모델을 학습하지 않고, 그룹 안 답변들의 평균 보상을 기준으로 각 답변의 상대적 우위를 계산한다.
언어 모델의 수학·추론 능력을 높이는 강화학습에 쓰이며, DeepSeek-R1 학습에도 사용됐다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.