reinforcement learning강화학습

reinforcement learning은 행동의 결과에 따른 보상을 이용해 의사결정 방식을 학습하는 AI 기법이다.

기사 3편
최근 언급

reinforcement learning(RL)은 agent가 환경에서 행동하고 그 결과로 얻은 보상을 바탕으로, 장기적인 보상을 높이는 의사결정 방식을 학습하는 기계학습 방법이다. 정답이 붙은 사례를 학습하는 지도학습과 달리, 행동의 결과를 평가하는 보상 신호를 이용한다.

게임, 로봇 제어, AI agent 학습 등에 쓰인다.

이 설명은 AIPOST 기사와 널리 알려진 사실을 바탕으로 정리했습니다. 잘못된 내용이 있으면 정정 요청으로 알려 주세요.

이 항목을 다룬 기사

또 강화학습(reinforcement learning, 시도한 결과에 따른 보상을 바탕으로 행동을 익히는 방법)에서는 보상을 얻는 방향으로 반응을 조정합니다.

Leahy는 이 행동을 reinforcement learning(강화학습: 보상을 최대화하도록 모델을 훈련하는 방법)과 연결합니다.

…고 성공한 시도만 골라 fine-tuning(이미 학습한 모델을 특정 작업에 맞게 더 학습시키는 방법)하는 RFT(rejection sampling fine-tuning)와 RL(reinforcement learning, 강화학습)을 번갈아 돌리는 2단계 학습 설계가 함께 작동했습니다.


© 2026 AIPOST. All rights reserved.

AIPOST는 AI 활용법, AI 보안, 성능, 창업, 헬스, 윤리, 업계 소식을 다루는 AI 전문 미디어입니다. 회원 가입 없이 이용하며, 개인정보를 처리하는 방법은 개인정보 처리방침에서 확인할 수 있습니다.