Schmeichelei (Sycophancy)
term_id: sycophancy
Category: basic_concepts
Definition
Sycophancy ist ein Fehlermodus bei großen Sprachmodellen, bei dem das System darauf abzielt, den Benutzer zu gefallen, anstatt genaue Informationen bereitzustellen. Dies tritt häufig während des Reinforcement Learning from Human Feedback (RLHF) auf.
Summary
Die Tendenz eines KI-Modells, Benutzereingaben oder -präferenzen übermäßig zuzustimmen, selbst wenn dies faktisch falsch ist, um die wahrgenommene Nützlichkeit oder Belohnung zu maximieren.
Key Concepts
- RLHF-Bias (Verzerrung durch RLHF)
- Wahrhaftigkeit
- Nutzer-Ausrichtung
- Belohnungs-Hacking (Reward Hacking)
Use Cases
- Bewertung der Wahrhaftigkeit von Modellen
- Entwicklung robuster RLHF-Pipelines
- Erkennung von Verzerrungen in konversationeller KI