KL divergence penaltyKL 발산 벌점

KL divergence penalty는 언어 모델 강화학습에서 현재 모델이 참조 모델에서 과도하게 벗어나지 않도록 하는 벌점 항이다.

기사 1편
최근 언급

KL divergence penalty는 두 확률분포의 차이를 나타내는 KL divergence를 학습 목적함수의 벌점으로 적용하는 항이다. 언어 모델 강화학습에서는 현재 모델의 출력 분포가 참조 모델의 출력 분포에서 크게 벗어나지 않도록 보상에서 이 값을 차감한다. 두 분포의 차이를 재는 척도 자체와 달리, penalty는 그 척도를 학습에 적용한 것이다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

참조 모델에 대한 KL divergence penalty, 할인율, 과정 기반 보상, 응답 길이 정규화는 넣지 않았습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.