Apprentissage par préférence

term_id: preference_learning

Category: training_techniques

Definition

L’apprentissage par préférence se concentre sur l’apprentissage des distinctions entre les bonnes et les mauvaises sorties sur la base de jugements humains plutôt que d’étiquettes absolues. Il implique généralement la collecte de paires de réponses où un humain indique sa préférence, permettant au modèle d’apprendre une fonction de récompense implicite.

Summary

Une technique qui entraîne les modèles à aligner leurs sorties avec les préférences humaines à l’aide de commentaires comparatifs.

Key Concepts

  • Retour humain
  • Comparaison par paires
  • Modélisation de la récompense
  • Alignement

Use Cases

  • RLHF pour les LLM
  • Systèmes de recommandation
  • Filtrage de modération de contenu