后训练post-training
后训练是在预训练之后,对语言模型的行为和能力进行调整的追加训练阶段。
1篇文章
最近提及 后训练是预训练之后各个训练阶段的统称。预训练让模型从海量数据中学到基本能力,后训练则把模型的行为调整到期望的方向,例如遵循指令、对话方式、推理能力和安全回应。
常用方法包括监督微调、基于人类偏好的强化学习,以及提升推理能力的强化学习。它也被用来从同一个基础模型衍生出不同用途的模型。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
后训练是在预训练之后,对语言模型的行为和能力进行调整的追加训练阶段。
后训练是预训练之后各个训练阶段的统称。预训练让模型从海量数据中学到基本能力,后训练则把模型的行为调整到期望的方向,例如遵循指令、对话方式、推理能力和安全回应。
常用方法包括监督微调、基于人类偏好的强化学习,以及提升推理能力的强化学习。它也被用来从同一个基础模型衍生出不同用途的模型。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。