on-policy
term_id: on_policy
Category: basic_concepts
Definition
Algoritmii on-policy necesită ca agentul să învețe direct din acțiunile întreprinse de politica sa curentă. Acest lucru înseamnă că datele colectate în timpul explorării sunt utilizate imediat pentru a actualiza politica, asigurând coerența.
Summary
O abordare de învățare prin întărire în care politica evaluată și îmbunătățită este aceeași cu cea utilizată pentru generarea datelor.
Key Concepts
- învățare prin întărire
- gradient de politică
- consistența datelor
- eficiența eșantionării
Use Cases
- Control robotic cu constrângeri de siguranță
- Agente de joc care necesită actualizări precise
- Sisteme adaptive în timp real