強化学習reinforcement learning
強化学習は、行動の結果に対する報酬を使って意思決定の方法を学ぶAI手法。
記事9本
最終言及 強化学習(RL)は、エージェントが環境の中で行動し、その結果に対する報酬を基に、長期的な報酬を高める意思決定を学ぶ機械学習の手法。正解が付いた事例から学ぶ教師あり学習とは異なり、行動の結果を評価する報酬信号を使う。
ゲーム、ロボット制御、AIエージェントの学習などに使われる。
この説明は、AIPOSTの記事と広く知られた事実をもとにまとめたものです。誤りがあれば訂正依頼でお知らせください。
この項目を扱った記事
コリソン氏はさらに、コンピューターユースをTransformer、大規模言語モデル、強化学習に続くAIの次の大きな一歩と呼びます。
走るロボットは、人間や動物の動作データで初期化した低レベルの強化学習コントローラーに頼っており、高レベルの推論はほとんど使っていないとみられます。
別の例では、独自のプログラミング言語と強化学習のループを作ったハッカソンの応募作品を複数ターンにわたって評価し、モデルが処理するテキストの単位であるトークンを200万以上使いながら、サンドボックスの状態を失いませんでした。
強化学習では、システムは報酬と罰から学びます。
強化学習も不確実性を生むもう一つの要因です。
9月のモデルは強化学習の最中でした。
この報告は、エージェントの行動を強化学習と結びつけています。
モデルの学習: 成功したタスクの実行結果をファインチューニング用の事例とし、強化学習ではさらに試行を重ねて動作を検証・改善します。