后训练post-training

后训练是在预训练之后,对语言模型的行为和能力进行调整的追加训练阶段。

1篇文章
最近提及

后训练是预训练之后各个训练阶段的统称。预训练让模型从海量数据中学到基本能力,后训练则把模型的行为调整到期望的方向,例如遵循指令、对话方式、推理能力和安全回应。

常用方法包括监督微调、基于人类偏好的强化学习,以及提升推理能力的强化学习。它也被用来从同一个基础模型衍生出不同用途的模型。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

而现代模型的基础推理能力是通过预训练“培养”出来的,预训练是在海量数据上进行的大规模学习阶段;微调和后训练则是事后附加的步骤,用来塑造模型的行为。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。