Attacco avversario

term_id: adversarial_attack

Category: ethics_safety

Definition

Gli attacchi avversari sfruttano le vulnerabilità delle reti neurali introducendo rumore sottile negli input, come immagini o testo, che provoca errori significativi nell’output del modello. Questi attacchi mettono in luce la fragilità dei modelli tradizionali.

Summary

Un attacco avversario è una tecnica in cui piccole perturbazioni, spesso impercettibili, vengono aggiunti ai dati di input per ingannare i modelli di apprendimento automatico e indurli a effettuare previsioni errate.

Key Concepts

  • Perturbazione
  • Robustezza del modello
  • White-box vs Black-box
  • Attacchi di evasione

Use Cases

  • Test della sicurezza del modello
  • Generazione di esempi avversari per l’addestramento
  • Analisi delle vulnerabilità nei sistemi di visione artificiale