선호도 학습
term_id: preference_learning
Category: training_techniques
Definition
선호도 학습은 절대적인 라벨이 아닌 인간의 판단을 바탕으로 모델이 좋은 출력과 나쁜 출력을 구분하도록 가르치는 데 중점을 둡니다. 일반적으로 이 과정에는 응답 쌍을 수집하고 인간이 이를 평가하는 작업이 포함됩니다.
Summary
비교 피드백을 사용하여 모델의 출력이 인간의 선호도와 일치하도록 훈련하는 기법입니다.
Key Concepts
- 인간 피드백
- 쌍별 비교
- 보상 모델링
- 정렬(얼라인먼트)
Use Cases
- 대규모 언어 모델(LLM)의 RLHF
- 추천 시스템
- 콘텐츠 모더레이션 필터링