Atac adversarial

term_id: adversarial_attack

Category: ethics_safety

Definition

Atacurile adversare exploatează vulnerabilitățile rețelelor neuronale introducând zgomot subtil în datele de intrare, cum ar fi imagini sau text, ceea ce provoacă erori semnificative în ieșirea modelului. Aceste atacuri evidențiază fragilitatea modelelor actuale în fața manipulărilor intenționate.

Summary

Un atac adversarial este o tehnică prin care perturbații mici, adesea imperceptibile, sunt adăugate datelor de intrare pentru a înșela modelele de învățare automată și a le determina să facă predicții incorecte.

Key Concepts

  • Perturbație
  • Robustețea modelului
  • Cutie albă vs. Cutie neagră
  • Atacuri de evaziune

Use Cases

  • Testarea securității modelului
  • Generarea de exemple adversare pentru antrenament
  • Analiza vulnerabilităților în sistemele de vedere pe calculator