基于人类反馈的强化学习RLHF
RLHF是一种方法:先根据人类对模型回答的比较与评分训练奖励模型,再用强化学习据此调整语言模型。
2篇文章
最近提及 RLHF(reinforcement learning from human feedback)先用人类在模型多个回答中挑选更优者或进行排序的数据训练奖励模型,再通过强化学习调整模型,使其最大化该奖励。
它是让大语言模型更符合人类意图的代表性后训练方法,曾用于ChatGPT等对话式AI的开发。与直接学习人类撰写的示范答案的监督微调不同,它以人类的相对偏好作为训练信号。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
RLHF(基于人类反馈的强化学习)利用人们对回答的评分来调整模型。