데이터셋: Nvidia/Helpsteer2

term_id: datasetnvidiahelpsteer2

Category: basic_concepts

Definition

Helpsteer2는 NVIDIA가 공개한 선별된 데이터셋으로, 대규모 언어 모델(LLM)이 생성한 응답들의 쌍별 비교(pairwise comparisons)를 포함합니다. 이 데이터셋은 유용성, 정확성, 안전성 등 다차원적인 인간의 선호도에 초점을 맞추고 있습니다.

Summary

인간 피드백을 통한 강화 학습(RLHF)에서 보상 모델을 훈련하기 위해 특별히 설계된 고품질의 인간 선호도 데이터셋입니다.

Key Concepts

  • RLHF (인간 피드백을 통한 강화 학습)
  • 보상 모델
  • 인간 선호도
  • 정렬 (Alignment)

Use Cases

  • LLM 정렬을 위한 보상 모델 학습
  • 모델의 유용성과 안전성 평가
  • 선호도 데이터를 이용한 베이스 모델 파인튜닝