拒绝采样微调rejection sampling fine-tuning

rejection sampling fine-tuning 是从多次尝试中筛选成功结果,用于继续训练模型的方法。

1篇文章
最近提及

rejection sampling fine-tuning 是让模型生成多个候选结果,筛选符合预设条件的结果,再将其作为样本对模型进行微调的方法。它与利用奖励信号优化模型行为的强化学习不同,训练材料是筛选后的结果。

本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。

涉及该条目的文章

拒绝采样微调(RFT)从大量任务运行中挑选成功尝试用于训练。


© 2026 AIPOST. All rights reserved.

AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。