정렬

term_id: alignment

Category: ethics_safety

Definition

정렬은 AI가 단순히 문자 그대로의 요청을 수행하는 것이 아니라 인간이 실제로 원하는 것을 수행하도록 하는 데 중점을 둡니다. 여기에는 인간 피드백을 통한 강화 학습(RLHF)과 같은 기술이 포함됩니다.

Summary

AI 시스템의 목표와 행동이 인간의 가치와 의도에 부합하도록 보장하는 과정입니다.

Key Concepts

  • RLHF (인간 피드백 기반 강화 학습)
  • 가치 로드
  • 의도 일치
  • 보상 모델링

Use Cases

  • 챗봇의 예의 바름 조정
  • 요약의 사실적 정확성 보장
  • 제일브레이크(우회 공격) 방지