on-policy

term_id: on_policy

Category: basic_concepts

Definition

On-policy-algoritmer kræver, at agenten lærer direkte fra de handlinger, den aktuelle politik tager. Dette betyder, at data, der indsamles under udforskning, straks bruges til at opdatere politikken, hvilket sikrer konsistens.

Summary

En tilgang inden for forstærkningslæring, hvor den politik, der evalueres og forbedres, er den samme som den, der bruges til at generere data.

Key Concepts

  • forstærkningslæring
  • policy gradient (politikgradient)
  • datakonsistens
  • prøveeffektivitet

Use Cases

  • Robotstyring med sikkerhedsbegrænsninger
  • Spillende agenter, der kræver præcise opdateringer
  • Systemer, der tilpasser sig i realtid