对抗攻击

term_id: adversarial_attack

Category: ethics_safety

Definition

对抗攻击通过向图像或文本等输入引入细微噪声,利用神经网络的漏洞,导致模型输出出现显著错误。这些攻击突显了模型在面临恶意输入时的脆弱性。

Summary

对抗攻击是一种技术,通过在输入数据中添加微小且通常不可察觉的扰动,欺骗机器学习模型做出错误的预测。

Key Concepts

  • 扰动
  • 模型鲁棒性
  • 白盒与黑盒
  • 逃避攻击

Use Cases

  • 测试模型安全性
  • 生成用于训练的对抗样本
  • 分析计算机视觉系统中的漏洞