动态采样dynamic sampling
动态采样是在训练过程中根据样本对模型的难度重新选择训练数据的方法。
1篇文章
最近提及 动态采样是在训练过程中根据样本难度或模型表现重新选择训练数据的方法,与事先固定样本的做法不同。在大语言模型的强化学习中,它作为字节跳动等于2025年发布的DAPO算法的组成部分而为人所知:模型全部答对或全部答错的提示会被剔除,以减少不提供学习信号的样本。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
动态采样是在训练过程中根据样本对模型的难度重新选择训练数据的方法。
动态采样是在训练过程中根据样本难度或模型表现重新选择训练数据的方法,与事先固定样本的做法不同。在大语言模型的强化学习中,它作为字节跳动等于2025年发布的DAPO算法的组成部分而为人所知:模型全部答对或全部答错的提示会被剔除,以减少不提供学习信号的样本。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
AIPOST是一家报道AI应用方法、AI安全、性能、创业、健康、伦理与行业资讯的AI专业媒体。无需注册即可使用,个人信息的处理方式请参阅隐私政策。