on-policy
term_id: on_policy
Category: basic_concepts
Definition
On-policy-algoritmer kræver, at agenten lærer direkte fra de handlinger, den aktuelle politik tager. Dette betyder, at data, der indsamles under udforskning, straks bruges til at opdatere politikken, hvilket sikrer konsistens.
Summary
En tilgang inden for forstærkningslæring, hvor den politik, der evalueres og forbedres, er den samme som den, der bruges til at generere data.
Key Concepts
- forstærkningslæring
- policy gradient (politikgradient)
- datakonsistens
- prøveeffektivitet
Use Cases
- Robotstyring med sikkerhedsbegrænsninger
- Spillende agenter, der kræver præcise opdateringer
- Systemer, der tilpasser sig i realtid