on-policy
term_id: on_policy
Category: basic_concepts
Definition
Az on-policy algoritmusok azt követelik meg, hogy az ügynök közvetlenül a jelenlegi politikája által tett cselekvésekből tanuljon. Ez azt jelenti, hogy a felfedezés során gyűjtött adatokat azonnal felhasználják a politika frissítésére, biztosítva az adatok konzisztenciáját.
Summary
Egy megerősítéses tanuló megközelítés, ahol az értéelt és fejlesztett politika ugyanaz, mint amelyiket az adatok generálásához használnak.
Key Concepts
- megerősítéses tanulás
- politika gradiens
- adat konzisztencia
- mintahatékonyság
Use Cases
- Robotika vezérlés biztonsági korlátokkal
- Pontos frissítéseket igénylő játékos ügynökök
- Valós idejű adaptív rendszerek