on-policy RL온폴리시 강화학습
on-policy RL은 현재 학습 중인 정책이 직접 생성한 경험으로 그 정책을 갱신하는 강화학습 방식이다.
기사 1편
최근 언급 on-policy RL은 현재 학습 중인 정책이 직접 생성한 행동과 결과를 이용해 그 정책을 갱신하는 강화학습 방식이다. 강화학습과 AI 모델의 학습에 쓰이며, 과거 정책이나 다른 정책이 모은 데이터도 활용하는 off-policy RL과 구별된다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.