オンポリシー

term_id: on_policy

Category: basic_concepts

Definition

オンポリシーアルゴリズムでは、エージェントは現在のポリシーによって取られた行動から直接学習する必要があります。これは、探索中に収集されたデータが即座にポリシーの更新に使用され、一貫性を確保することを意味します。

Summary

評価および改善されるポリシーが、データ生成に使用されるポリシーと同じである強化学習のアプローチ。

Key Concepts

  • 強化学習
  • ポリシー勾配
  • データの一貫性
  • サンプル効率

Use Cases

  • 安全性制約のあるロボティクス制御
  • 正確な更新を必要とするゲームプレイエージェント
  • リアルタイム適応システム