Backdoor-Angriff
term_id: backdoor_attack
Category: ethics_safety
Definition
Ein Backdoor-Angriff beinhaltet das Vergiften der Trainingsdaten eines maschinellen Lernmodells mit bestimmten Mustern, sogenannten Triggern. Während das Modell bei sauberen Daten normal funktioniert, aktiviert es bei Vorhandensein des Triggers falsches Verhalten.
Summary
Eine Sicherheitsbedrohung, bei der böswillige Akteure versteckte Auslöser in KI-Modellen während des Trainings einbetten, um spezifische Fehlklassifikationen auszulösen.
Key Concepts
- Data Poisoning (Datenvergiftung)
- Modellintegrität
- Adversarial Machine Learning
- Trigger-Muster
Use Cases
- Sicherheitstests von ML-Pipelines
- Entwicklung defensiver Filter
- Auditierung von Drittanbieter-Modellen