Aprendizado por Reforço a partir de Feedback Humano
term_id: rlhf
Category: training_techniques
Definition
O Aprendizado por Reforço a partir de Feedback Humano (RLHF) é um método usado para ajustar finamente grandes modelos de linguagem para que suas saídas estejam mais alinhadas com os valores e expectativas humanos. Geralmente envolve três etapas
Summary
O RLHF é uma técnica que alinha modelos de IA às preferências humanas usando feedback humano para treinar um modelo de recompensa para aprendizado por reforço.
Key Concepts
- Dados de Preferência
- Modelo de Recompensa
- Alinhamento
- PPO (Otimização de Política Próxima)
Use Cases
- Refinamento de chatbots
- Moderação de conteúdo
- Melhoria no seguimento de instruções