Adversariële aanval
term_id: adversarial_attack
Category: ethics_safety
Definition
Adversariële aanvallen benutten de kwetsbaarheden van neurale netwerken door subtiele ruis aan invoergegevens, zoals afbeeldingen of tekst, toe te voegen, wat aanzienlijke fouten in de modeluitvoer veroorzaakt. Deze aanvallen onderstrepen hoe gevoelig modellen zijn voor kleine wijzigingen die voor mensen onopvallend blijven, maar cruciale beslissingen kunnen verstoren.
Summary
Een adversariële aanval is een techniek waarbij kleine, vaak onzichtbare verstoringen worden toegevoegd aan invoergegevens om machine learning-modellen te misleiden tot het maken van onjuiste voorspellingen.
Key Concepts
- Verstoring
- Modelrobustheid
- Wit-doos versus Zwart-doos
- Ontwijkingsaanvallen
Use Cases
- Testen van modelbeveiliging
- Genereren van adversariële voorbeelden voor training
- Analyseren van kwetsbaarheden in computersystemen voor visuele waarneming