on-policy

term_id: on_policy

Category: basic_concepts

Definition

Gli algoritmi on-policy richiedono che l’agente impari direttamente dalle azioni intraprese dalla sua politica corrente. Ciò significa che i dati raccolti durante l’esplorazione vengono utilizzati immediatamente per aggiornare la politica, garantendo coerenza.

Summary

Un approccio di apprendimento per rinforzo in cui la politica valutata e migliorata è la stessa utilizzata per generare i dati.

Key Concepts

  • apprendimento per rinforzo
  • policy gradient (gradiente della politica)
  • coerenza dei dati
  • efficienza campionaria

Use Cases

  • Controllo robotico con vincoli di sicurezza
  • Agenti per giochi che richiedono aggiornamenti precisi
  • Sistemi adattivi in tempo reale