Präferenzlernen

term_id: preference_learning

Category: training_techniques

Definition

Präferenzlernen konzentriert sich darauf, Modelle beizubringen, zwischen guten und schlechten Ausgaben basierend auf menschlichen Urteilen zu unterscheiden, anstatt sich auf absolute Labels zu verlassen. Dies beinhaltet typischerweise das Sammeln von Antwortpaaren, bei denen menschliche Bewerter die bevorzugte Antwort markieren, um ein Belohnungsmodell zu trainieren.

Summary

Eine Technik, die Modelle trainiert, um Ausgaben an menschliche Präferenzen anzupassen, indem vergleichendes Feedback verwendet wird.

Key Concepts

  • Menschliches Feedback
  • Paarweiser Vergleich
  • Belohnungsmodellierung
  • Ausrichtung (Alignment)

Use Cases

  • RLHF für große Sprachmodelle
  • Empfehlungssysteme
  • Filterung von Inhaltsmoderation