Adversáriális támadás

term_id: adversarial_attack

Category: ethics_safety

Definition

Az adversáriális támadások kihasználják a neurális hálózatok sebezhetőségeit a bemenetekbe (például képek vagy szöveg) bevezetett finom zajok révén, amelyek jelentős hibákat okoznak a modell kimenetében. Ezek a támadások kiemelik…

Summary

Az adversáriális támadás egy technika, amely során apró, gyakran észrevehetetlen zavaró jeleket (perturbációkat) adnak hozzá a bemeneti adatokhoz, hogy megtévesszék a gépi tanulási modelleket és hibás előrejelzéseket kényszerítsenek rájuk.

Key Concepts

  • Zavaró jel (Perturbáció)
  • Modell robusztusság
  • Fehér doboz vs. fekete doboz
  • Kitérési támadások (Evasion Attacks)

Use Cases

  • Modellek biztonságának tesztelése
  • Adversáriális példák generálása a tanításhoz
  • Sebezhetőségek elemzése a számítógépes látás rendszereiben