on-policy
term_id: on_policy
Category: basic_concepts
Definition
Algorytmy on-policy wymagają, aby agent uczył się bezpośrednio z działań podejmowanych przez swoją aktualną politykę. Oznacza to, że dane zebrane podczas eksploracji są natychmiast wykorzystywane do aktualizacji polityki, zapewniając…
Summary
Podejście uczenia przez wzmacnianie, w którym polityka oceniana i ulepszana jest tą samą polityką, która generuje dane.
Key Concepts
- uczenie przez wzmacnianie
- gradient polityki (policy gradient)
- spójność danych
- efektywność próbkowania
Use Cases
- Sterowanie robotyką z ograniczeniami bezpieczeństwa
- Agenty do gier wymagające precyzyjnych aktualizacji
- Systemy adaptacyjne w czasie rzeczywistym