GRPOグループ相対方策最適化

GRPOは、同じ入力に対する複数の回答の報酬を比較してAIモデルを改善する強化学習アルゴリズムである。

記事1本
最終言及

GRPO(Group Relative Policy Optimization)は、同じプロンプトから複数の回答を生成し、グループ内で報酬を比較してモデルの方策を改善する強化学習アルゴリズムである。DeepSeekが2024年のDeepSeekMathの論文で提案した。PPOと異なり独立した価値モデルを学習せず、グループ内の平均報酬を基準に各回答の相対的な優位性を計算する。

言語モデルの数学・推論能力を高める強化学習に用いられ、DeepSeek-R1の学習にも使われた。

この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。

この項目を扱った記事

RLの段階では、YutoriはMilesフレームワークを用いた非同期のGroup Relative Policy Optimization(GRPO)を使います。


© 2026 AIPOST. All rights reserved.

AIPOSTは、AIの活用法、AIセキュリティ、性能、起業、ヘルスケア、倫理、業界ニュースを扱うAI専門メディアです。会員登録なしで利用でき、個人情報の取り扱いはプライバシーポリシーで確認できます。