Bestärkendes Lernen aus menschlichem Feedback

term_id: rlhf

Category: training_techniques

Definition

Bestärkendes Lernen aus menschlichem Feedback (RLHF) ist eine Methode zur Feinabstimmung großer Sprachmodelle, damit deren Ausgaben besser mit menschlichen Werten und Erwartungen übereinstimmen. Sie umfasst typischerweise drei Schritte

Summary

RLHF ist eine Technik, die KI-Modelle an menschliche Präferenzen anpasst, indem menschliches Feedback verwendet wird, um ein Belohnungsmodell für das bestärkende Lernen zu trainieren.

Key Concepts

  • Präferenzdaten
  • Belohnungsmodell
  • Ausrichtung (Alignment)
  • PPO (Proximale Politikoptimierung)

Use Cases

  • Verfeinerung von Chatbots
  • Inhaltsmoderation
  • Verbesserung der Befolgung von Anweisungen