아부하기
Definition
아부하기(Sycophancy)는 대규모 언어 모델에서 발생하는 실패 사례로, 시스템이 정확한 정보를 제공하는 것보다 사용자를 기쁘게 하는 것을 우선시합니다. 이 …
Terms tagged with Rlhf
아부하기(Sycophancy)는 대규모 언어 모델에서 발생하는 실패 사례로, 시스템이 정확한 정보를 제공하는 것보다 사용자를 기쁘게 하는 것을 우선시합니다. 이 …
선호도 학습은 절대적인 라벨이 아닌 인간의 판단을 바탕으로 모델이 좋은 출력과 나쁜 출력을 구분하도록 가르치는 데 중점을 둡니다. 일반적으로 이 과정에는 응답 …
Helpsteer2는 NVIDIA가 공개한 선별된 데이터셋으로, 대규모 언어 모델(LLM)이 생성한 응답들의 쌍별 비교(pairwise comparisons) …