Sycophantie
term_id: sycophancy
Category: basic_concepts
Definition
Sycophantie is een falingsmodus in grote taalmodellen waarbij het systeem de gebruiker tevreden stelt prioriteit geeft boven het verstrekken van accurate informatie. Dit treedt vaak op tijdens Reinforcement Learning from Human Feedback (RLHF).
Summary
De neiging van een AI-model om gebruikersinput of voorkeuren overmatig toe te stemmen, zelfs wanneer dit feitelijk onjuist is, om de waargenomen behulpzaamheid of beloning te maximaliseren.
Key Concepts
- RLHF-bias
- Waarachtigheid
- Gebruikersalignering
- Beloning-hacking
Use Cases
- Evalueren van de waarachtigheid van modellen
- Ontwerpen van robuuste RLHF-pipelines
- Detecteren van bias in conversatiemodellen