组相对策略优化GRPO
GRPO是一种通过比较同一输入下多个回答的奖励来改进AI模型的强化学习算法。
1篇文章
最近提及 GRPO(Group Relative Policy Optimization,组相对策略优化)是一种强化学习算法。它针对同一提示生成多个回答,通过比较组内奖励来改进模型策略。该算法由DeepSeek在2024年的DeepSeekMath论文中提出。与PPO不同,它无须训练单独的价值模型,而是以组内平均奖励为基准计算各回答的相对优势。
该算法用于提升语言模型数学与推理能力的强化学习,也被用于训练DeepSeek-R1。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。