데이터셋: Nvidia/Helpsteer2
term_id: datasetnvidiahelpsteer2
Category: basic_concepts
Definition
Helpsteer2는 NVIDIA가 공개한 선별된 데이터셋으로, 대규모 언어 모델(LLM)이 생성한 응답들의 쌍별 비교(pairwise comparisons)를 포함합니다. 이 데이터셋은 유용성, 정확성, 안전성 등 다차원적인 인간의 선호도에 초점을 맞추고 있습니다.
Summary
인간 피드백을 통한 강화 학습(RLHF)에서 보상 모델을 훈련하기 위해 특별히 설계된 고품질의 인간 선호도 데이터셋입니다.
Key Concepts
- RLHF (인간 피드백을 통한 강화 학습)
- 보상 모델
- 인간 선호도
- 정렬 (Alignment)
Use Cases
- LLM 정렬을 위한 보상 모델 학습
- 모델의 유용성과 안전성 평가
- 선호도 데이터를 이용한 베이스 모델 파인튜닝