Uczenie preferencji
term_id: preference_learning
Category: training_techniques
Definition
Uczenie preferencji koncentruje się na nauce modeli rozróżniania między dobrymi a złymi wynikami na podstawie ocen ludzkich, a nie absolutnych etykiet. Zazwyczaj polega to na zbieraniu par odpowiedzi, gdzie człowiek wskazuje preferowaną opcję, co pozwala modelowi nauczyć się funkcji nagrody lub porządkować wyniki zgodnie z subiektywnymi oczekiwaniami użytkowników.
Summary
Technika trenująca modele do dopasowywania wyników do ludzkich preferencji za pomocą informacji zwrotnej porównawczej.
Key Concepts
- Informacja zwrotna od człowieka
- Porównanie parami
- Modelowanie nagrody
- Wyrównanie (alignment)
Use Cases
- RLHF dla dużych modeli językowych
- Systemy rekomendacyjne
- Filtrowanie treści moderacyjnych