on-policy

term_id: on_policy

Category: basic_concepts

Definition

Les algorithmes on-policy exigent que l’apprentissage se fasse directement à partir des actions effectuées par sa politique actuelle. Cela signifie que les données collectées lors de l’exploration sont utilisées immédiatement pour mettre à jour la politique, garantissant ainsi la cohérence des données.

Summary

Une approche d’apprentissage par renforcement où la politique évaluée et améliorée est identique à celle utilisée pour générer les données.

Key Concepts

  • apprentissage par renforcement
  • gradient de politique
  • cohérence des données
  • efficacité d’échantillonnage

Use Cases

  • Contrôle robotique avec contraintes de sécurité
  • Agents de jeu nécessitant des mises à jour précises
  • Systèmes adaptatifs en temps réel