on-policy

term_id: on_policy

Category: basic_concepts

Definition

On-policy-algoritmer krever at agenten lærer direkte fra handlingene tatt av sin nåværende politikk. Dette betyr at data samlet under utforskning umiddelbart brukes til å oppdatere politikken, noe som sikrer konsistens.

Summary

En tilnærming innen forsterkningslæring der politikken som evalueres og forbedres, er den samme som den som brukes til å generere data.

Key Concepts

  • forsterkningslæring
  • politikkgradient
  • datasamsvar
  • prøveeffektivitet

Use Cases

  • Robotstyring med sikkerhetsbegrensninger
  • Spillende agenter som krever presise oppdateringer
  • Sanntids adaptive systemer