GRPOグループ相対方策最適化
GRPOは、同じ入力に対する複数の回答の報酬を比較してAIモデルを改善する強化学習アルゴリズムである。
記事1本
最終言及 GRPO(Group Relative Policy Optimization)は、同じプロンプトから複数の回答を生成し、グループ内で報酬を比較してモデルの方策を改善する強化学習アルゴリズムである。DeepSeekが2024年のDeepSeekMathの論文で提案した。PPOと異なり独立した価値モデルを学習せず、グループ内の平均報酬を基準に各回答の相対的な優位性を計算する。
言語モデルの数学・推論能力を高める強化学習に用いられ、DeepSeek-R1の学習にも使われた。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。