Aprendizado por Reforço a partir de Feedback Humano

term_id: rlhf

Category: training_techniques

Definition

O Aprendizado por Reforço a partir de Feedback Humano (RLHF) é um método usado para ajustar finamente grandes modelos de linguagem para que suas saídas estejam mais alinhadas com os valores e expectativas humanos. Geralmente envolve três etapas

Summary

O RLHF é uma técnica que alinha modelos de IA às preferências humanas usando feedback humano para treinar um modelo de recompensa para aprendizado por reforço.

Key Concepts

  • Dados de Preferência
  • Modelo de Recompensa
  • Alinhamento
  • PPO (Otimização de Política Próxima)

Use Cases

  • Refinamento de chatbots
  • Moderação de conteúdo
  • Melhoria no seguimento de instruções