on-policy (na política)
term_id: on_policy
Category: basic_concepts
Definition
Os algoritmos on-policy exigem que o agente aprenda diretamente a partir das ações tomadas por sua política atual. Isso significa que os dados coletados durante a exploração são usados imediatamente para atualizar a política, garantindo
Summary
Uma abordagem de aprendizado por reforço na qual a política sendo avaliada e melhorada é a mesma usada para gerar os dados.
Key Concepts
- aprendizado por reforço
- gradiente de política
- consistência dos dados
- eficiência amostral
Use Cases
- Controle de robótica com restrições de segurança
- Agentes de jogos que exigem atualizações precisas
- Sistemas adaptativos em tempo real