on-policy

term_id: on_policy

Category: basic_concepts

Definition

Algoritma on-policy mengharuskan agen belajar secara langsung dari tindakan yang diambil oleh kebijakannya saat ini. Ini berarti data yang dikumpulkan selama eksplorasi digunakan segera untuk memperbarui kebijakan, memastikan konsistensi distribusi data.

Summary

Pendekatan pembelajaran penguatan di mana kebijakan yang dievaluasi dan ditingkatkan adalah sama dengan kebijakan yang digunakan untuk menghasilkan data.

Key Concepts

  • pembelajaran penguatan
  • gradien kebijakan
  • konsistensi data
  • efisiensi sampel

Use Cases

  • Kontrol robotika dengan batasan keamanan
  • Agen permainan yang memerlukan pembaruan presisi
  • Sistem adaptif waktu nyata