Uczenie preferencji

term_id: preference_learning

Category: training_techniques

Definition

Uczenie preferencji koncentruje się na nauce modeli rozróżniania między dobrymi a złymi wynikami na podstawie ocen ludzkich, a nie absolutnych etykiet. Zazwyczaj polega to na zbieraniu par odpowiedzi, gdzie człowiek wskazuje preferowaną opcję, co pozwala modelowi nauczyć się funkcji nagrody lub porządkować wyniki zgodnie z subiektywnymi oczekiwaniami użytkowników.

Summary

Technika trenująca modele do dopasowywania wyników do ludzkich preferencji za pomocą informacji zwrotnej porównawczej.

Key Concepts

  • Informacja zwrotna od człowieka
  • Porównanie parami
  • Modelowanie nagrody
  • Wyrównanie (alignment)

Use Cases

  • RLHF dla dużych modeli językowych
  • Systemy rekomendacyjne
  • Filtrowanie treści moderacyjnych