AI 정렬(AI alignment)

term_id: ai_alignment

Category: ethics_safety

Definition

AI 정렬은 인공지능 시스템이 사용자가 문자 그대로 지시한 것보다 사용자가 의도한 바를 강력하게 수행하도록 만드는 과제를 다룹니다. 이는 AI 시스템이 인간의 가치와 의도를 이해하고 따르도록 하는 기술적 방법론을 포함하며, 해석 가능성(interpretability)과 제어 문제(control problem) 해결을 핵심으로 합니다.

Summary

AI 시스템이 인간의 가치와 의도에 부합하도록 행동하도록 보장하는 연구 분야입니다.

Key Concepts

  • 가치 학습(value learning)
  • 유익한 행동(beneficial behavior)
  • 제어 문제(control problem)
  • 해석 가능성(interpretability)

Use Cases

  • 대규모 언어 모델의 안전성 연구
  • RLHF(인간 피드백 기반 강화 학습)를 위한 보상 함수 개발
  • 윤리적 가이드라인 구현