Apprentissage par renforcement à partir de retours humains
term_id: rlhf
Category: training_techniques
Definition
L’apprentissage par renforcement à partir de retours humains (RLHF) est une méthode utilisée pour affiner les grands modèles de langage afin que leurs sorties s’alignent mieux avec les valeurs et les attentes humaines. Elle implique généralement trois étapes
Summary
Le RLHF est une technique qui aligne les modèles d’IA sur les préférences humaines en utilisant les retours humains pour entraîner un modèle de récompense pour l’apprentissage par renforcement.
Key Concepts
- Données de préférence
- Modèle de récompense
- Alignement
- PPO (Optimisation de la politique proximale)
Use Cases
- Affinement des chatbots
- Modération de contenu
- Amélioration du respect des instructions