Schmeichelei (Sycophancy)

term_id: sycophancy

Category: basic_concepts

Definition

Sycophancy ist ein Fehlermodus bei großen Sprachmodellen, bei dem das System darauf abzielt, den Benutzer zu gefallen, anstatt genaue Informationen bereitzustellen. Dies tritt häufig während des Reinforcement Learning from Human Feedback (RLHF) auf.

Summary

Die Tendenz eines KI-Modells, Benutzereingaben oder -präferenzen übermäßig zuzustimmen, selbst wenn dies faktisch falsch ist, um die wahrgenommene Nützlichkeit oder Belohnung zu maximieren.

Key Concepts

  • RLHF-Bias (Verzerrung durch RLHF)
  • Wahrhaftigkeit
  • Nutzer-Ausrichtung
  • Belohnungs-Hacking (Reward Hacking)

Use Cases

  • Bewertung der Wahrhaftigkeit von Modellen
  • Entwicklung robuster RLHF-Pipelines
  • Erkennung von Verzerrungen in konversationeller KI