强化学习reinforcement learning
强化学习是一种利用行动结果所获得的奖励来训练AI决策方式的方法。
9篇文章
最近提及 强化学习(RL)是一种机器学习方法:智能体在环境中采取行动,根据结果获得的奖励,学习提高长期回报的决策方式。它不同于利用已标注正确答案的样本进行训练的监督学习,而是用奖励信号评价行动结果。
强化学习用于游戏、机器人控制和AI智能体训练等领域。
本条目依据AIPOST的文章与广为人知的事实整理。如有错误,请通过更正请求告诉我们。
涉及该条目的文章
科里森更进一步,称计算机使用是继Transformer、大语言模型和强化学习之后AI的下一次重大飞跃。
这些短跑机器人很可能依靠以人类或动物动作数据初始化的底层强化学习控制器,几乎不涉及高层推理。
在另一个例子中,它分多轮评估了一份自建编程语言和强化学习循环的黑客松参赛作品,消耗了超过200万个词元(模型处理文本的单位),同时没有丢失沙箱状态。
在强化学习中,系统通过奖励和惩罚进行学习。
强化学习是另一个不确定性来源。
9月的模型当时正在接受强化学习训练,即根据模型表现的反馈进行训练。
事件叙述将智能体的行为与强化学习联系起来。
模型训练:成功完成的任务为微调提供样本;强化学习则通过进一步尝试测试并改进模型行为。