on-policy

term_id: on_policy

Category: basic_concepts

Definition

Algorytmy on-policy wymagają, aby agent uczył się bezpośrednio z działań podejmowanych przez swoją aktualną politykę. Oznacza to, że dane zebrane podczas eksploracji są natychmiast wykorzystywane do aktualizacji polityki, zapewniając…

Summary

Podejście uczenia przez wzmacnianie, w którym polityka oceniana i ulepszana jest tą samą polityką, która generuje dane.

Key Concepts

  • uczenie przez wzmacnianie
  • gradient polityki (policy gradient)
  • spójność danych
  • efektywność próbkowania

Use Cases

  • Sterowanie robotyką z ograniczeniami bezpieczeństwa
  • Agenty do gier wymagające precyzyjnych aktualizacji
  • Systemy adaptacyjne w czasie rzeczywistym