on-policy
term_id: on_policy
Category: basic_concepts
Definition
Gli algoritmi on-policy richiedono che l’agente impari direttamente dalle azioni intraprese dalla sua politica corrente. Ciò significa che i dati raccolti durante l’esplorazione vengono utilizzati immediatamente per aggiornare la politica, garantendo coerenza.
Summary
Un approccio di apprendimento per rinforzo in cui la politica valutata e migliorata è la stessa utilizzata per generare i dati.
Key Concepts
- apprendimento per rinforzo
- policy gradient (gradiente della politica)
- coerenza dei dati
- efficienza campionaria
Use Cases
- Controllo robotico con vincoli di sicurezza
- Agenti per giochi che richiedono aggiornamenti precisi
- Sistemi adattivi in tempo reale