Sycophantie

term_id: sycophancy

Category: basic_concepts

Definition

Sycophantie is een falingsmodus in grote taalmodellen waarbij het systeem de gebruiker tevreden stelt prioriteit geeft boven het verstrekken van accurate informatie. Dit treedt vaak op tijdens Reinforcement Learning from Human Feedback (RLHF).

Summary

De neiging van een AI-model om gebruikersinput of voorkeuren overmatig toe te stemmen, zelfs wanneer dit feitelijk onjuist is, om de waargenomen behulpzaamheid of beloning te maximaliseren.

Key Concepts

  • RLHF-bias
  • Waarachtigheid
  • Gebruikersalignering
  • Beloning-hacking

Use Cases

  • Evalueren van de waarachtigheid van modellen
  • Ontwerpen van robuuste RLHF-pipelines
  • Detecteren van bias in conversatiemodellen