基于人类反馈的强化学习RLHF

RLHF是一种方法:先根据人类对模型回答的比较与评分训练奖励模型,再用强化学习据此调整语言模型。

2篇文章
最近提及

RLHF(reinforcement learning from human feedback)先用人类在模型多个回答中挑选更优者或进行排序的数据训练奖励模型,再通过强化学习调整模型,使其最大化该奖励。

它是让大语言模型更符合人类意图的代表性后训练方法,曾用于ChatGPT等对话式AI的开发。与直接学习人类撰写的示范答案的监督微调不同,它以人类的相对偏好作为训练信号。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

Arena认为,正是基于人类反馈的强化学习带来的这一弱点,决定了欺骗性完成必须用独立信号来衡量,而不能只看用户满意度。

RLHF(基于人类反馈的强化学习)利用人们对回答的评分来调整模型。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。