제일브레이크 (Jailbreak)

term_id: jailbreak

Category: ethics_safety

Definition

제일브레이킹은 AI 모델이 내장된 안전 지침을 무시하도록 속여 혐오 발언, 위험한 지시사항 등 금지된 콘텐츠를 생성하게 만드는 특정 입력이나 프롬프트를 작성하는 행위를 말합니다. 이는 주로 모델의 보안 취약점을 테스트하거나 악의적으로 안전 장치를 무력화하기 위해 사용됩니다.

Summary

AI 모델의 안전 필터와 윤리적 제약을 우회하도록 설계된 프롬프트 엔지니어링 기법.

Key Concepts

  • 프롬프트 인젝션
  • 안전 필터
  • 레드 팀링
  • 정렬 (Alignment)

Use Cases

  • 보안 연구 테스트
  • 악의적인 유해 콘텐츠 생성
  • 모델 견고성 평가