적대적 공격

term_id: adversarial_attack

Category: ethics_safety

Definition

적대적 공격은 이미지나 텍스트와 같은 입력에 미세한 노이즈를 도입하여 신경망의 취약점을 이용합니다. 이는 모델 출력에 심각한 오류를 유발하며, 모델의 보안성을 테스트하거나 취약점을 분석하는 데 사용됩니다.

Summary

작지만 종종 인지 불가능한 교란을 입력 데이터에 추가하여 머신러닝 모델을 속이고 잘못된 예측을 수행하게 하는 기술입니다.

Key Concepts

  • 교란
  • 모델 견고성
  • 화이트박스 vs 블랙박스
  • 회피 공격

Use Cases

  • 모델 보안 테스트
  • 학습을 위한 적대적 예제 생성
  • 컴퓨터 비전 시스템의 취약점 분석