Adversarial angreb

term_id: adversarial_attack

Category: ethics_safety

Definition

Adversarial angreb udnytter sårbarhederne i neurale netværk ved at indføre subtil støj i inputs, såsom billeder eller tekst, hvilket forårsager betydelige fejl i modellens output. Disse angreb fremhæver modellernes begrænsninger i at håndtere manipulerede data.

Summary

Et adversarialt angreb er en teknik, hvor små, ofte usynlige forstyrrelser tilføjes inputdata for at vildlede maskinlæringsmodeller og få dem til at træffe forkerte forudsigelser.

Key Concepts

  • Forstyrrelse
  • Modellens robusthed
  • Hvid-boks vs. sort-boks
  • Undvigelsesangreb

Use Cases

  • Testning af modelsikkerhed
  • Generering af adversariale eksempler til træning
  • Analyse af sårbarheder i computersynssystemer