선호도 학습

term_id: preference_learning

Category: training_techniques

Definition

선호도 학습은 절대적인 라벨이 아닌 인간의 판단을 바탕으로 모델이 좋은 출력과 나쁜 출력을 구분하도록 가르치는 데 중점을 둡니다. 일반적으로 이 과정에는 응답 쌍을 수집하고 인간이 이를 평가하는 작업이 포함됩니다.

Summary

비교 피드백을 사용하여 모델의 출력이 인간의 선호도와 일치하도록 훈련하는 기법입니다.

Key Concepts

  • 인간 피드백
  • 쌍별 비교
  • 보상 모델링
  • 정렬(얼라인먼트)

Use Cases

  • 대규모 언어 모델(LLM)의 RLHF
  • 추천 시스템
  • 콘텐츠 모더레이션 필터링