on-policy
term_id: on_policy
Category: basic_concepts
Definition
Les algorithmes on-policy exigent que l’apprentissage se fasse directement à partir des actions effectuées par sa politique actuelle. Cela signifie que les données collectées lors de l’exploration sont utilisées immédiatement pour mettre à jour la politique, garantissant ainsi la cohérence des données.
Summary
Une approche d’apprentissage par renforcement où la politique évaluée et améliorée est identique à celle utilisée pour générer les données.
Key Concepts
- apprentissage par renforcement
- gradient de politique
- cohérence des données
- efficacité d’échantillonnage
Use Cases
- Contrôle robotique avec contraintes de sécurité
- Agents de jeu nécessitant des mises à jour précises
- Systèmes adaptatifs en temps réel