Apprentissage par préférence
term_id: preference_learning
Category: training_techniques
Definition
L’apprentissage par préférence se concentre sur l’apprentissage des distinctions entre les bonnes et les mauvaises sorties sur la base de jugements humains plutôt que d’étiquettes absolues. Il implique généralement la collecte de paires de réponses où un humain indique sa préférence, permettant au modèle d’apprendre une fonction de récompense implicite.
Summary
Une technique qui entraîne les modèles à aligner leurs sorties avec les préférences humaines à l’aide de commentaires comparatifs.
Key Concepts
- Retour humain
- Comparaison par paires
- Modélisation de la récompense
- Alignement
Use Cases
- RLHF pour les LLM
- Systèmes de recommandation
- Filtrage de modération de contenu