on-policy (εντός πολιτικής)

term_id: on_policy

Category: basic_concepts

Definition

Τα αλγόριθμα on-policy απαιτούν ο πράκτορας να μαθαίνει απευθείας από τις ενέργειες που λαμβάνονται από την τρέχουσα πολιτική του. Αυτό σημαίνει ότι τα δεδομένα που συλλέγονται κατά την εξερεύνηση χρησιμοποιούνται άμεσα για την ενημέρωση της πολιτικής, διασφαλίζοντας τη συνέπεια.

Summary

Μια προσέγγιση ενισχυτικής μάθησης όπου η πολιτική που αξιολογείται και βελτιώνεται είναι η ίδια με αυτή που χρησιμοποιείται για τη δημιουργία δεδομένων.

Key Concepts

  • ενισχυτική μάθηση
  • κλίση πολιτικής (policy gradient)
  • συνέπεια δεδομένων
  • απόδοση δειγματοληψίας

Use Cases

  • Έλεγχος robotics με περιορισμούς ασφαλείας
  • Πράκτορες παιχνιδιών που απαιτούν ακριβείς ενημερώσεις
  • Συστήματα προσαρμογής σε πραγματικό χρόνο