Attacco avversario
term_id: adversarial_attack
Category: ethics_safety
Definition
Gli attacchi avversari sfruttano le vulnerabilità delle reti neurali introducendo rumore sottile negli input, come immagini o testo, che provoca errori significativi nell’output del modello. Questi attacchi mettono in luce la fragilità dei modelli tradizionali.
Summary
Un attacco avversario è una tecnica in cui piccole perturbazioni, spesso impercettibili, vengono aggiunti ai dati di input per ingannare i modelli di apprendimento automatico e indurli a effettuare previsioni errate.
Key Concepts
- Perturbazione
- Robustezza del modello
- White-box vs Black-box
- Attacchi di evasione
Use Cases
- Test della sicurezza del modello
- Generazione di esempi avversari per l’addestramento
- Analisi delle vulnerabilità nei sistemi di visione artificiale