정렬
term_id: alignment
Category: ethics_safety
Definition
정렬은 AI가 단순히 문자 그대로의 요청을 수행하는 것이 아니라 인간이 실제로 원하는 것을 수행하도록 하는 데 중점을 둡니다. 여기에는 인간 피드백을 통한 강화 학습(RLHF)과 같은 기술이 포함됩니다.
Summary
AI 시스템의 목표와 행동이 인간의 가치와 의도에 부합하도록 보장하는 과정입니다.
Key Concepts
- RLHF (인간 피드백 기반 강화 학습)
- 가치 로드
- 의도 일치
- 보상 모델링
Use Cases
- 챗봇의 예의 바름 조정
- 요약의 사실적 정확성 보장
- 제일브레이크(우회 공격) 방지