on-policy

term_id: on_policy

Category: basic_concepts

Definition

Az on-policy algoritmusok azt követelik meg, hogy az ügynök közvetlenül a jelenlegi politikája által tett cselekvésekből tanuljon. Ez azt jelenti, hogy a felfedezés során gyűjtött adatokat azonnal felhasználják a politika frissítésére, biztosítva az adatok konzisztenciáját.

Summary

Egy megerősítéses tanuló megközelítés, ahol az értéelt és fejlesztett politika ugyanaz, mint amelyiket az adatok generálásához használnak.

Key Concepts

  • megerősítéses tanulás
  • politika gradiens
  • adat konzisztencia
  • mintahatékonyság

Use Cases

  • Robotika vezérlés biztonsági korlátokkal
  • Pontos frissítéseket igénylő játékos ügynökök
  • Valós idejű adaptív rendszerek