Attaque adversariale
term_id: adversarial_attack
Category: ethics_safety
Definition
Les attaques adversariales exploitent les vulnérabilités des réseaux de neurones en introduisant un bruit subtil dans les entrées, telles que des images ou du texte, ce qui provoque des erreurs significatives dans la sortie du modèle. Ces attaques mettent en lumière la sensibilité des modèles aux variations minimes des données.
Summary
Une attaque adversariale est une technique consistant à ajouter de petites perturbations, souvent imperceptibles, aux données d’entrée pour tromper les modèles d’apprentissage automatique et les amener à faire des prédictions erronées.
Key Concepts
- Perturbation
- Robustesse du modèle
- Boîte blanche vs Boîte noire
- Attaques par évasion
Use Cases
- Test de la sécurité des modèles
- Génération d’exemples adversariaux pour l’entraînement
- Analyse de la vulnérabilité des systèmes de vision par ordinateur