on-policy
term_id: on_policy
Category: basic_concepts
Definition
On-policy-algoritmer kräver att agenten lär sig direkt från de handlingar som tas av dess nuvarande policy. Detta innebär att data som samlas in under utforskning används omedelbart för att uppdatera policyn, vilket säkerställer…
Summary
En förstärkningsinlärningsansats där den policy som utvärderas och förbättras är densamma som den som används för att generera data.
Key Concepts
- förstärkningsinlärning
- policy gradient
- datakonsekvens
- provs effektivitet
Use Cases
- Robotstyrning med säkerhetsbegränsningar
- Spelande agenter som kräver precisa uppdateringar
- System som anpassas i realtid