on-policy
term_id: on_policy
Category: basic_concepts
Definition
Algoritmy on-policy vyžadují, aby se agent učil přímo z akcí podniknutých jeho aktuální politikou. To znamená, že data shromážděná během průzkumu jsou okamžitě použita k aktualizaci politiky, čímž se zajišťuje…
Summary
Přístup posilovaného učení, kde politika, která je vyhodnocována a zlepšována, je stejná jako ta, která generuje data.
Key Concepts
- posilované učení
- gradient politiky (policy gradient)
- konzistence dat
- efektivita vzorkování
Use Cases
- Řízení robotiky s bezpečnostními omezeními
- Herní agenti vyžadující přesné aktualizace
- Reálné adaptivní systémy