Bestärkendes Lernen aus menschlichem Feedback
term_id: rlhf
Category: training_techniques
Definition
Bestärkendes Lernen aus menschlichem Feedback (RLHF) ist eine Methode zur Feinabstimmung großer Sprachmodelle, damit deren Ausgaben besser mit menschlichen Werten und Erwartungen übereinstimmen. Sie umfasst typischerweise drei Schritte
Summary
RLHF ist eine Technik, die KI-Modelle an menschliche Präferenzen anpasst, indem menschliches Feedback verwendet wird, um ein Belohnungsmodell für das bestärkende Lernen zu trainieren.
Key Concepts
- Präferenzdaten
- Belohnungsmodell
- Ausrichtung (Alignment)
- PPO (Proximale Politikoptimierung)
Use Cases
- Verfeinerung von Chatbots
- Inhaltsmoderation
- Verbesserung der Befolgung von Anweisungen