on-policy

term_id: on_policy

Category: basic_concepts

Definition

Algoritmii on-policy necesită ca agentul să învețe direct din acțiunile întreprinse de politica sa curentă. Acest lucru înseamnă că datele colectate în timpul explorării sunt utilizate imediat pentru a actualiza politica, asigurând coerența.

Summary

O abordare de învățare prin întărire în care politica evaluată și îmbunătățită este aceeași cu cea utilizată pentru generarea datelor.

Key Concepts

  • învățare prin întărire
  • gradient de politică
  • consistența datelor
  • eficiența eșantionării

Use Cases

  • Control robotic cu constrângeri de siguranță
  • Agente de joc care necesită actualizări precise
  • Sisteme adaptive în timp real