GRPO그룹 상대 정책 최적화

GRPO는 같은 입력에 대한 여러 답변의 보상을 서로 비교해 AI 모델을 개선하는 강화학습 알고리즘이다.

기사 1편
최근 언급

GRPO(Group Relative Policy Optimization, 그룹 상대 정책 최적화)는 같은 prompt(모델에 주는 입력)에 대한 여러 답변을 생성하고, 그룹 안에서 보상을 비교해 모델의 응답 방식을 개선하는 강화학습 알고리즘이다. DeepSeek가 2024년 DeepSeekMath 논문에서 제안했다. PPO와 달리 별도의 가치 모델을 학습하지 않고, 그룹 안 답변들의 평균 보상을 기준으로 각 답변의 상대적 우위를 계산한다.

언어 모델의 수학·추론 능력을 높이는 강화학습에 쓰이며, DeepSeek-R1 학습에도 사용됐다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

완전 비동기 GRPO(여러 시도를 묶어 상대 비교로 정책을 개선하는 RL 알고리즘)를 오픈소스 Miles 프레임워크로 구현했고, rollout 생성은 GPU 기울기 갱신과 나란히 비동기로 돌리되 rollout이 얼마나 뒤처져도 되는지에 상한을 둡니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.