Apprentissage par renforcement à partir de retours humains

term_id: rlhf

Category: training_techniques

Definition

L’apprentissage par renforcement à partir de retours humains (RLHF) est une méthode utilisée pour affiner les grands modèles de langage afin que leurs sorties s’alignent mieux avec les valeurs et les attentes humaines. Elle implique généralement trois étapes

Summary

Le RLHF est une technique qui aligne les modèles d’IA sur les préférences humaines en utilisant les retours humains pour entraîner un modèle de récompense pour l’apprentissage par renforcement.

Key Concepts

  • Données de préférence
  • Modèle de récompense
  • Alignement
  • PPO (Optimisation de la politique proximale)

Use Cases

  • Affinement des chatbots
  • Modération de contenu
  • Amélioration du respect des instructions