Tấn công Backdoor (Cửa sau)

term_id: backdoor_attack

Category: ethics_safety

Definition

Một cuộc tấn công backdoor liên quan đến việc đầu độc dữ liệu huấn luyện của mô hình học máy với các mẫu cụ thể, được gọi là kích hoạt. Trong khi mô hình hoạt động bình thường trên dữ liệu sạch, nó sẽ kích hoạt hành vi sai lệch khi gặp các kích hoạt này.

Summary

Một mối đe dọa bảo mật nơi các tác nhân độc hại nhúng các kích hoạt ẩn vào mô hình AI trong quá trình huấn luyện để gây ra lỗi phân loại cụ thể.

Key Concepts

  • Đầu độc dữ liệu
  • Tính toàn vẹn của mô hình
  • Học máy đối kháng
  • Mẫu kích hoạt

Use Cases

  • Kiểm tra bảo mật cho quy trình ML
  • Phát triển bộ lọc phòng thủ
  • Kiểm toán các mô hình bên thứ ba