on-policy (он-полиси)

term_id: on_policy

Category: basic_concepts

Definition

Алгоритмы on-policy требуют, чтобы агент учился непосредственно на действиях, совершаемых его текущей политикой. Это означает, что данные, собранные во время исследования среды, используются немедленно для обновления политики, обеспечивая согласованность выборки.

Summary

Подход обучения с подкреплением, при котором политика, которая оценивается и улучшается, является той же самой, что используется для генерации данных.

Key Concepts

  • обучение с подкреплением
  • градиент политики (policy gradient)
  • согласованность данных
  • эффективность выборки

Use Cases

  • Управление роботами с ограничениями безопасности
  • Агенты для игр, требующие точных обновлений
  • Системы адаптации в реальном времени