on-policy (chính sách hiện tại)

term_id: on_policy

Category: basic_concepts

Definition

Các thuật toán on-policy yêu cầu tác tử học trực tiếp từ các hành động do chính sách hiện tại của nó thực hiện. Điều này có nghĩa là dữ liệu thu thập được trong quá trình khám phá sẽ được sử dụng ngay lập tức để cập nhật chính sách, đảm bảo tính nhất quán.

Summary

Một cách tiếp cận học tăng cường trong đó chính sách đang được đánh giá và cải tiến chính là chính sách được sử dụng để tạo ra dữ liệu.

Key Concepts

  • học tăng cường
  • gradient chính sách
  • nhất quán dữ liệu
  • hiệu quả mẫu

Use Cases

  • Điều khiển robot với các ràng buộc về an toàn
  • Các tác tử chơi trò chơi đòi hỏi cập nhật chính xác
  • Hệ thống thích ứng theo thời gian thực