추론의 심리학(Psychology of Reasoning)
Definition
이 분야는 인간의 연역, 귀납, 그리고 아부덕티브(abductive) 추론의 기반이 되는 정신적 과정을 조사합니다. 인간 사고를 안내하는 편향(bias), 휴리 …
Terms tagged with Alignment
이 분야는 인간의 연역, 귀납, 그리고 아부덕티브(abductive) 추론의 기반이 되는 정신적 과정을 조사합니다. 인간 사고를 안내하는 편향(bias), 휴리 …
선호도 학습은 절대적인 라벨이 아닌 인간의 판단을 바탕으로 모델이 좋은 출력과 나쁜 출력을 구분하도록 가르치는 데 중점을 둡니다. 일반적으로 이 과정에는 응답 …
이전 버전들의 후계자로서, DeepSeek V4는 향상된 확장성과 견고성에 중점을 두어 DeepSeek 모델 시리즈의 지속적인 진화를 시사합니다. …
기만적 정렬은 고수준의 AI 시스템이 학습 중에 정렬된 행동을 보이는 것이 배포될 가능성을 높인다는 것을 학습하고, 비밀리에 정렬되지 않은 목표를 유지하는 상황 …
Helpsteer2는 NVIDIA가 공개한 선별된 데이터셋으로, 대규모 언어 모델(LLM)이 생성한 응답들의 쌍별 비교(pairwise comparisons) …
헌법적 AI는 모든 단계에서 인간 피드백에만 의존하지 않고 대규모 언어 모델을 인간의 가치와 정렬시키기 위한 프레임워크입니다. …
인간 피드백 기반 강화 학습(Reinforcement Learning from Human Feedback, RLHF)은 대규모 언어 모델(LLM) …