Adversarial angreb
term_id: adversarial_attack
Category: ethics_safety
Definition
Adversarial angreb udnytter sårbarhederne i neurale netværk ved at indføre subtil støj i inputs, såsom billeder eller tekst, hvilket forårsager betydelige fejl i modellens output. Disse angreb fremhæver modellernes begrænsninger i at håndtere manipulerede data.
Summary
Et adversarialt angreb er en teknik, hvor små, ofte usynlige forstyrrelser tilføjes inputdata for at vildlede maskinlæringsmodeller og få dem til at træffe forkerte forudsigelser.
Key Concepts
- Forstyrrelse
- Modellens robusthed
- Hvid-boks vs. sort-boks
- Undvigelsesangreb
Use Cases
- Testning af modelsikkerhed
- Generering af adversariale eksempler til træning
- Analyse af sårbarheder i computersynssystemer