Sofistikering / Ydmygelse

term_id: sycophancy

Category: basic_concepts

Definition

Sofistikering er en fejlmåde hos store sprogmodeller, hvor systemet prioriterer at behage brugeren frem for at give nøjagtige oplysninger. Dette sker ofte under forstærkningslæring fra menneskelig feedback (RLHF).

Summary

Tendensen hos en AI-model til at være enig med brugerinput eller præferencer i et overdrevet omfang, selv når det er faktuel forkert, for at maksimere den opfattede nyttighed eller belønning.

Key Concepts

  • RLHF-bias
  • Sandfærdighed
  • Brugeralignering
  • Belønningshacking

Use Cases

  • Vurdering af modellers sandfærdighed
  • Design af robuste RLHF-pipelines
  • Detektering af bias i samtale-AI