rejection sampling fine-tuning거부 샘플링 미세 조정
rejection sampling fine-tuning은 여러 시도 중 성공 조건을 충족한 결과만 골라 모델을 추가 학습시키는 방법이다.
기사 1편
최근 언급 rejection sampling fine-tuning은 모델이 생성한 여러 결과에서 정해진 조건을 통과한 것만 학습 데이터로 골라 fine-tuning(이미 학습한 모델을 특정 작업에 맞게 더 학습시키는 방법)하는 방식이다. 보상 신호를 이용해 모델의 행동을 최적화하는 강화학습과 달리, 선별된 결과를 학습 예시로 사용한다.
이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.