棄却サンプリングによるファインチューニングrejection sampling fine-tuning
rejection sampling fine-tuningは、複数の試行から成功条件を満たす結果を選び、モデルを追加学習させる方法である。
記事1本
最終言及 rejection sampling fine-tuningは、モデルが生成した複数の候補から所定の条件を満たす結果を選び、それを学習例としてモデルを追加学習させる方法である。報酬信号を使って行動を最適化する強化学習とは、選別した結果を学習データに用いる点で異なる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。