on-policy RL온폴리시 강화학습

on-policy RL은 현재 학습 중인 정책이 직접 생성한 경험으로 그 정책을 갱신하는 강화학습 방식이다.

기사 1편
최근 언급

on-policy RL은 현재 학습 중인 정책이 직접 생성한 행동과 결과를 이용해 그 정책을 갱신하는 강화학습 방식이다. 강화학습과 AI 모델의 학습에 쓰이며, 과거 정책이나 다른 정책이 모은 데이터도 활용하는 off-policy RL과 구별된다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

지도학습 방식의 fine-tuning이 이전 데이터 분포를 잊기 쉬운 반면, on-policy RL은 더 단순한 작업에 대한 역량을 비교적 잘 보존합니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.