人間のフィードバックによる強化学習RLHF

RLHFは、人間がモデルの回答を比較・評価した結果から報酬モデルを作り、それを使った強化学習で言語モデルを調整する手法である。

記事2本
最終言及

RLHF(reinforcement learning from human feedback)は、モデルが出した複数の回答のうち人間がより良いものを選んだり順位を付けたりしたデータで報酬モデルを学習させ、その報酬を最大化するように強化学習でモデルを調整する手法である。

大規模言語モデルを人間の意図に沿うよう整える代表的な事後学習の手法で、ChatGPTのような対話型AIの開発に使われた。人間が書いた模範回答をそのまま学習させる教師ありファインチューニングとは異なり、人間の相対的な好みを学習信号として使う。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

Arenaは、人間のフィードバックによる強化学習が持ち込むこの弱点こそが、偽りの完了報告をユーザー満足度だけでなく独立したシグナルで測るべき理由だと主張しています。

RLHF(人間のフィードバックによる強化学習)は、回答に対する人間の評価を使ってモデルを調整する手法です。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。