RLHF인간 피드백 기반 강화 학습

RLHF는 사람이 모델의 답을 비교·평가한 결과로 보상 모델을 만들고, 이를 이용해 강화 학습으로 언어 모델을 조정하는 방법이다.

기사 1편
최근 언급

RLHF(reinforcement learning from human feedback)는 사람이 모델이 낸 여러 답 가운데 더 나은 것을 고르거나 순위를 매긴 데이터로 보상 모델을 학습시키고, 그 보상을 최대화하도록 강화 학습으로 모델을 조정하는 방법이다.

대규모 언어 모델을 사람의 의도에 맞게 다듬는 대표적인 사후 학습 방법으로, ChatGPT 같은 대화형 AI의 개발에 쓰였다. 사람이 쓴 모범 답안을 그대로 학습시키는 지도 fine-tuning과 달리 사람의 상대적인 선호를 학습 신호로 쓴다는 점이 다르다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

칭찬받는 답을 배우는 RLHF


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.