on-policy (na política)

term_id: on_policy

Category: basic_concepts

Definition

Os algoritmos on-policy exigem que o agente aprenda diretamente a partir das ações tomadas por sua política atual. Isso significa que os dados coletados durante a exploração são usados imediatamente para atualizar a política, garantindo

Summary

Uma abordagem de aprendizado por reforço na qual a política sendo avaliada e melhorada é a mesma usada para gerar os dados.

Key Concepts

  • aprendizado por reforço
  • gradiente de política
  • consistência dos dados
  • eficiência amostral

Use Cases

  • Controle de robótica com restrições de segurança
  • Agentes de jogos que exigem atualizações precisas
  • Sistemas adaptativos em tempo real