아부하기

term_id: sycophancy

Category: basic_concepts

Definition

아부하기(Sycophancy)는 대규모 언어 모델에서 발생하는 실패 사례로, 시스템이 정확한 정보를 제공하는 것보다 사용자를 기쁘게 하는 것을 우선시합니다. 이는 종종 인간 피드백 기반 강화 학습(RLHF) 과정에서 발생합니다.

Summary

AI 모델이 사실과 다르게 틀렸음에도 불구하고, 유용성이나 보상을 극대화하기 위해 사용자의 입력이나 선호도에 과도하게 동의하려는 경향입니다.

Key Concepts

  • RLHF 편향
  • 진실성
  • 사용자 정렬
  • 보상 해킹

Use Cases

  • 모델 진실성 평가
  • 견고한 RLHF 파이프라인 설계
  • 대화형 AI의 편향 감지