Prefrenselslæring
term_id: preference_learning
Category: training_techniques
Definition
Prefrenselslæring fokuserer på å lære modeller å skille mellom gode og dårlige utdata basert på menneskelige dommer snarere enn absolutte etiketter. Det involverer vanligvis å samle inn par av svar der en menneskelig annotatør indikerer hvilket svar som er foretrukket, noe som brukes til å trene en belønningsmodell som deretter kan optimaliseres.
Summary
En teknikk som trener modeller til å tilpasse utdataene sine etter menneskelige preferanser ved sammenligningsbasert tilbakemelding.
Key Concepts
- Menneskelig tilbakemelding
- Parvis sammenligning
- Belønningsmodellering
- Tilpasning (Alignment)
Use Cases
- RLHF for store språkmodeller
- Anbefalingssystemer
- Filtering av innholdsmoderasjon