Präferenzlernen
term_id: preference_learning
Category: training_techniques
Definition
Präferenzlernen konzentriert sich darauf, Modelle beizubringen, zwischen guten und schlechten Ausgaben basierend auf menschlichen Urteilen zu unterscheiden, anstatt sich auf absolute Labels zu verlassen. Dies beinhaltet typischerweise das Sammeln von Antwortpaaren, bei denen menschliche Bewerter die bevorzugte Antwort markieren, um ein Belohnungsmodell zu trainieren.
Summary
Eine Technik, die Modelle trainiert, um Ausgaben an menschliche Präferenzen anzupassen, indem vergleichendes Feedback verwendet wird.
Key Concepts
- Menschliches Feedback
- Paarweiser Vergleich
- Belohnungsmodellierung
- Ausrichtung (Alignment)
Use Cases
- RLHF für große Sprachmodelle
- Empfehlungssysteme
- Filterung von Inhaltsmoderation