On-Policy
term_id: on_policy
Category: basic_concepts
Definition
On-Policy-Algorithmen erfordern, dass der Agent direkt aus den Aktionen lernt, die von seiner aktuellen Policy unternommen werden. Das bedeutet, dass während der Exploration gesammelte Daten sofort verwendet werden, um die Policy zu aktualisieren, wodurch Konsistenz gewährleistet wird.
Summary
Ein Ansatz des bestärkenden Lernens (Reinforcement Learning), bei dem die bewertete und verbesserte Policy dieselbe ist, die zur Datengenerierung verwendet wird.
Key Concepts
- bestärkendes Lernen
- Policy Gradient
- Datenkonsistenz
- Sample Efficiency
Use Cases
- Robotiksteuerung mit Sicherheitsbeschränkungen
- Spielagenten, die präzise Updates benötigen
- Echtzeit-Adaptive Systeme