on-policy
term_id: on_policy
Category: basic_concepts
Definition
Algoritma on-policy mengharuskan agen belajar secara langsung dari tindakan yang diambil oleh kebijakannya saat ini. Ini berarti data yang dikumpulkan selama eksplorasi digunakan segera untuk memperbarui kebijakan, memastikan konsistensi distribusi data.
Summary
Pendekatan pembelajaran penguatan di mana kebijakan yang dievaluasi dan ditingkatkan adalah sama dengan kebijakan yang digunakan untuk menghasilkan data.
Key Concepts
- pembelajaran penguatan
- gradien kebijakan
- konsistensi data
- efisiensi sampel
Use Cases
- Kontrol robotika dengan batasan keamanan
- Agen permainan yang memerlukan pembaruan presisi
- Sistem adaptif waktu nyata