on-policy (chính sách hiện tại)
term_id: on_policy
Category: basic_concepts
Definition
Các thuật toán on-policy yêu cầu tác tử học trực tiếp từ các hành động do chính sách hiện tại của nó thực hiện. Điều này có nghĩa là dữ liệu thu thập được trong quá trình khám phá sẽ được sử dụng ngay lập tức để cập nhật chính sách, đảm bảo tính nhất quán.
Summary
Một cách tiếp cận học tăng cường trong đó chính sách đang được đánh giá và cải tiến chính là chính sách được sử dụng để tạo ra dữ liệu.
Key Concepts
- học tăng cường
- gradient chính sách
- nhất quán dữ liệu
- hiệu quả mẫu
Use Cases
- Điều khiển robot với các ràng buộc về an toàn
- Các tác tử chơi trò chơi đòi hỏi cập nhật chính xác
- Hệ thống thích ứng theo thời gian thực