在线策略

term_id: on_policy

Category: basic_concepts

Definition

在线策略算法要求智能体直接从其当前策略所采取的动作中学习。这意味着在探索过程中收集的数据被立即用于更新策略,从而确保数据分布的一致性。

Summary

一种强化学习方法,其中被评估和改进的策略与用于生成数据的策略相同。

Key Concepts

  • 强化学习
  • 策略梯度
  • 数据一致性
  • 样本效率

Use Cases

  • 具有安全约束的机器人控制
  • 需要精确更新的博弈代理
  • 实时自适应系统