on-policy

term_id: on_policy

Category: basic_concepts

Definition

On-policy-algoritmit vaativat, että agentti oppii suoraan nykyisen politiikkansa tekemistä toimista. Tämä tarkoittaa, että tutkimisen aikana kerätty dataa käytetään välittömästi politiikan päivittämiseen, varmistamalla

Summary

Vahvistusoppimisen lähestymistapa, jossa arvioitavaa ja parannettavaa politiikkaa käytetään myös datan tuottamiseen.

Key Concepts

  • vahvistusoppiminen
  • politiikkagradientti
  • datan johdonmukaisuus
  • näytteen tehokkuus

Use Cases

  • Robotiikan ohjaus turvarajoitteilla
  • Pelissä toimivat agentit, jotka vaativat tarkkoja päivityksiä
  • Reaaliaikaiset sopeutuvat järjestelmät