on-policy
term_id: on_policy
Category: basic_concepts
Definition
On-policy-algoritmer krever at agenten lærer direkte fra handlingene tatt av sin nåværende politikk. Dette betyr at data samlet under utforskning umiddelbart brukes til å oppdatere politikken, noe som sikrer konsistens.
Summary
En tilnærming innen forsterkningslæring der politikken som evalueres og forbedres, er den samme som den som brukes til å generere data.
Key Concepts
- forsterkningslæring
- politikkgradient
- datasamsvar
- prøveeffektivitet
Use Cases
- Robotstyring med sikkerhetsbegrensninger
- Spillende agenter som krever presise oppdateringer
- Sanntids adaptive systemer