on-policy

term_id: on_policy

Category: basic_concepts

Definition

Algoritmy on-policy vyžadují, aby se agent učil přímo z akcí podniknutých jeho aktuální politikou. To znamená, že data shromážděná během průzkumu jsou okamžitě použita k aktualizaci politiky, čímž se zajišťuje…

Summary

Přístup posilovaného učení, kde politika, která je vyhodnocována a zlepšována, je stejná jako ta, která generuje data.

Key Concepts

  • posilované učení
  • gradient politiky (policy gradient)
  • konzistence dat
  • efektivita vzorkování

Use Cases

  • Řízení robotiky s bezpečnostními omezeními
  • Herní agenti vyžadující přesné aktualizace
  • Reálné adaptivní systémy