on-policy
term_id: on_policy
Category: basic_concepts
Definition
On-policy-algoritmit vaativat, että agentti oppii suoraan nykyisen politiikkansa tekemistä toimista. Tämä tarkoittaa, että tutkimisen aikana kerätty dataa käytetään välittömästi politiikan päivittämiseen, varmistamalla
Summary
Vahvistusoppimisen lähestymistapa, jossa arvioitavaa ja parannettavaa politiikkaa käytetään myös datan tuottamiseen.
Key Concepts
- vahvistusoppiminen
- politiikkagradientti
- datan johdonmukaisuus
- näytteen tehokkuus
Use Cases
- Robotiikan ohjaus turvarajoitteilla
- Pelissä toimivat agentit, jotka vaativat tarkkoja päivityksiä
- Reaaliaikaiset sopeutuvat järjestelmät