Prefrenselslæring

term_id: preference_learning

Category: training_techniques

Definition

Prefrenselslæring fokuserer på å lære modeller å skille mellom gode og dårlige utdata basert på menneskelige dommer snarere enn absolutte etiketter. Det involverer vanligvis å samle inn par av svar der en menneskelig annotatør indikerer hvilket svar som er foretrukket, noe som brukes til å trene en belønningsmodell som deretter kan optimaliseres.

Summary

En teknikk som trener modeller til å tilpasse utdataene sine etter menneskelige preferanser ved sammenligningsbasert tilbakemelding.

Key Concepts

  • Menneskelig tilbakemelding
  • Parvis sammenligning
  • Belønningsmodellering
  • Tilpasning (Alignment)

Use Cases

  • RLHF for store språkmodeller
  • Anbefalingssystemer
  • Filtering av innholdsmoderasjon