Sofistikering / Ydmygelse
term_id: sycophancy
Category: basic_concepts
Definition
Sofistikering er en fejlmåde hos store sprogmodeller, hvor systemet prioriterer at behage brugeren frem for at give nøjagtige oplysninger. Dette sker ofte under forstærkningslæring fra menneskelig feedback (RLHF).
Summary
Tendensen hos en AI-model til at være enig med brugerinput eller præferencer i et overdrevet omfang, selv når det er faktuel forkert, for at maksimere den opfattede nyttighed eller belønning.
Key Concepts
- RLHF-bias
- Sandfærdighed
- Brugeralignering
- Belønningshacking
Use Cases
- Vurdering af modellers sandfærdighed
- Design af robuste RLHF-pipelines
- Detektering af bias i samtale-AI