Præferencelæring

term_id: preference_learning

Category: training_techniques

Definition

Præferencelæring fokuserer på at undervise modeller i at skelne mellem gode og dårlige output baseret på menneskelige domme snarere end absolutte etiketter. Det involverer typisk indsamling af par af svar, hvor et menneske angiver, hvilket der foretrækker, hvilket muliggør træning af belønningsmodeller.

Summary

En teknik, der træner modeller til at aligne output med menneskelige præferencer ved hjælp af sammenlignende feedback.

Key Concepts

  • Menneskelig feedback
  • Parvis sammenligning
  • Belønningsmodellering
  • Alignering

Use Cases

  • RLHF til store sprogmodeller
  • Anbefalingssystemer
  • Indholdsmodereringsfiltrering