on-policy (εντός πολιτικής)
term_id: on_policy
Category: basic_concepts
Definition
Τα αλγόριθμα on-policy απαιτούν ο πράκτορας να μαθαίνει απευθείας από τις ενέργειες που λαμβάνονται από την τρέχουσα πολιτική του. Αυτό σημαίνει ότι τα δεδομένα που συλλέγονται κατά την εξερεύνηση χρησιμοποιούνται άμεσα για την ενημέρωση της πολιτικής, διασφαλίζοντας τη συνέπεια.
Summary
Μια προσέγγιση ενισχυτικής μάθησης όπου η πολιτική που αξιολογείται και βελτιώνεται είναι η ίδια με αυτή που χρησιμοποιείται για τη δημιουργία δεδομένων.
Key Concepts
- ενισχυτική μάθηση
- κλίση πολιτικής (policy gradient)
- συνέπεια δεδομένων
- απόδοση δειγματοληψίας
Use Cases
- Έλεγχος robotics με περιορισμούς ασφαλείας
- Πράκτορες παιχνιδιών που απαιτούν ακριβείς ενημερώσεις
- Συστήματα προσαρμογής σε πραγματικό χρόνο