On-Policy

term_id: on_policy

Category: basic_concepts

Definition

On-Policy-Algorithmen erfordern, dass der Agent direkt aus den Aktionen lernt, die von seiner aktuellen Policy unternommen werden. Das bedeutet, dass während der Exploration gesammelte Daten sofort verwendet werden, um die Policy zu aktualisieren, wodurch Konsistenz gewährleistet wird.

Summary

Ein Ansatz des bestärkenden Lernens (Reinforcement Learning), bei dem die bewertete und verbesserte Policy dieselbe ist, die zur Datengenerierung verwendet wird.

Key Concepts

  • bestärkendes Lernen
  • Policy Gradient
  • Datenkonsistenz
  • Sample Efficiency

Use Cases

  • Robotiksteuerung mit Sicherheitsbeschränkungen
  • Spielagenten, die präzise Updates benötigen
  • Echtzeit-Adaptive Systeme