Attaque adversariale

term_id: adversarial_attack

Category: ethics_safety

Definition

Les attaques adversariales exploitent les vulnérabilités des réseaux de neurones en introduisant un bruit subtil dans les entrées, telles que des images ou du texte, ce qui provoque des erreurs significatives dans la sortie du modèle. Ces attaques mettent en lumière la sensibilité des modèles aux variations minimes des données.

Summary

Une attaque adversariale est une technique consistant à ajouter de petites perturbations, souvent imperceptibles, aux données d’entrée pour tromper les modèles d’apprentissage automatique et les amener à faire des prédictions erronées.

Key Concepts

  • Perturbation
  • Robustesse du modèle
  • Boîte blanche vs Boîte noire
  • Attaques par évasion

Use Cases

  • Test de la sécurité des modèles
  • Génération d’exemples adversariaux pour l’entraînement
  • Analyse de la vulnérabilité des systèmes de vision par ordinateur