Preferensinlärning

term_id: preference_learning

Category: training_techniques

Definition

Preferensinlärning fokuserar på att lära modeller att skilja mellan bra och dåliga utdata baserat på mänskliga omdömen snarare än absoluta etiketter. Det involverar vanligtvis insamling av par av svar där en människa indikerar vilken som är föredragen, vilket sedan används för att träna en belöningsmodell som kan generalisera dessa preferenser.

Summary

En teknik som tränar modeller för att anpassa utdata efter mänskliga preferenser med hjälp av jämförande feedback.

Key Concepts

  • Mänsklig feedback
  • Parsvis jämförelse
  • Belöningsmodellering
  • Alignering

Use Cases

  • RLHF för stora språkmodeller
  • Rekommendationssystem
  • Filtrering av innehållsmoderation