组相对策略优化GRPO

GRPO是一种通过比较同一输入下多个回答的奖励来改进AI模型的强化学习算法。

1篇文章
最近提及

GRPO(Group Relative Policy Optimization,组相对策略优化)是一种强化学习算法。它针对同一提示生成多个回答,通过比较组内奖励来改进模型策略。该算法由DeepSeek在2024年的DeepSeekMath论文中提出。与PPO不同,它无须训练单独的价值模型,而是以组内平均奖励为基准计算各回答的相对优势。

该算法用于提升语言模型数学与推理能力的强化学习,也被用于训练DeepSeek-R1。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

在强化学习阶段,Yutori使用Miles框架实施异步组相对策略优化(GRPO)。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。