Backdoor-Angriff

term_id: backdoor_attack

Category: ethics_safety

Definition

Ein Backdoor-Angriff beinhaltet das Vergiften der Trainingsdaten eines maschinellen Lernmodells mit bestimmten Mustern, sogenannten Triggern. Während das Modell bei sauberen Daten normal funktioniert, aktiviert es bei Vorhandensein des Triggers falsches Verhalten.

Summary

Eine Sicherheitsbedrohung, bei der böswillige Akteure versteckte Auslöser in KI-Modellen während des Trainings einbetten, um spezifische Fehlklassifikationen auszulösen.

Key Concepts

  • Data Poisoning (Datenvergiftung)
  • Modellintegrität
  • Adversarial Machine Learning
  • Trigger-Muster

Use Cases

  • Sicherheitstests von ML-Pipelines
  • Entwicklung defensiver Filter
  • Auditierung von Drittanbieter-Modellen