Preferensinlärning
term_id: preference_learning
Category: training_techniques
Definition
Preferensinlärning fokuserar på att lära modeller att skilja mellan bra och dåliga utdata baserat på mänskliga omdömen snarare än absoluta etiketter. Det involverar vanligtvis insamling av par av svar där en människa indikerar vilken som är föredragen, vilket sedan används för att träna en belöningsmodell som kan generalisera dessa preferenser.
Summary
En teknik som tränar modeller för att anpassa utdata efter mänskliga preferenser med hjälp av jämförande feedback.
Key Concepts
- Mänsklig feedback
- Parsvis jämförelse
- Belöningsmodellering
- Alignering
Use Cases
- RLHF för stora språkmodeller
- Rekommendationssystem
- Filtrering av innehållsmoderation