Præferencelæring
term_id: preference_learning
Category: training_techniques
Definition
Præferencelæring fokuserer på at undervise modeller i at skelne mellem gode og dårlige output baseret på menneskelige domme snarere end absolutte etiketter. Det involverer typisk indsamling af par af svar, hvor et menneske angiver, hvilket der foretrækker, hvilket muliggør træning af belønningsmodeller.
Summary
En teknik, der træner modeller til at aligne output med menneskelige præferencer ved hjælp af sammenlignende feedback.
Key Concepts
- Menneskelig feedback
- Parvis sammenligning
- Belønningsmodellering
- Alignering
Use Cases
- RLHF til store sprogmodeller
- Anbefalingssystemer
- Indholdsmodereringsfiltrering