Adversarialer Angriff
term_id: adversarial_attack
Category: ethics_safety
Definition
Adversariale Angriffe nutzen die Anfälligkeiten neuronaler Netze aus, indem sie subtile Rauschsignale in Eingaben wie Bilder oder Texte einführen, was zu erheblichen Fehlern im Modellausgang führt. Diese Angriffe unterstreichen die Notwendigkeit robuster Modelle.
Summary
Ein adversarialer Angriff ist eine Technik, bei der kleine, oft unmerkliche Störungen zu Eingabedaten hinzugefügt werden, um Machine-Learning-Modelle dazu zu verleiten, falsche Vorhersagen zu treffen.
Key Concepts
- Störung (Perturbation)
- Modellrobustheit
- White-Box vs. Black-Box
- Ausweichangriffe (Evasion Attacks)
Use Cases
- Testen der Modelsicherheit
- Generierung adversarialer Beispiele für das Training
- Analyse von Schwachstellen in Computersystemen