on-policy (он-полиси)
term_id: on_policy
Category: basic_concepts
Definition
Алгоритмы on-policy требуют, чтобы агент учился непосредственно на действиях, совершаемых его текущей политикой. Это означает, что данные, собранные во время исследования среды, используются немедленно для обновления политики, обеспечивая согласованность выборки.
Summary
Подход обучения с подкреплением, при котором политика, которая оценивается и улучшается, является той же самой, что используется для генерации данных.
Key Concepts
- обучение с подкреплением
- градиент политики (policy gradient)
- согласованность данных
- эффективность выборки
Use Cases
- Управление роботами с ограничениями безопасности
- Агенты для игр, требующие точных обновлений
- Системы адаптации в реальном времени