Ataque de Porta dos Fundos

term_id: backdoor_attack

Category: ethics_safety

Definition

Um ataque de porta dos fundos envolve envenenar os dados de treinamento de um modelo de aprendizado de máquina com padrões específicos, conhecidos como gatilhos. Embora o modelo funcione normalmente em dados limpos, ele ativa comportamentos incorretos quando o gatilho é detectado, permitindo que atacantes controlem a saída do modelo.

Summary

Uma ameaça de segurança na qual agentes mal-intencionados inserem gatilhos ocultos em modelos de IA durante o treinamento para causar classificações específicas incorretas.

Key Concepts

  • Envenenamento de Dados
  • Integridade do Modelo
  • Aprendizado de Máquina Adversarial
  • Padrões de Gatilho

Use Cases

  • Testes de segurança de pipelines de ML
  • Desenvolvimento de filtros defensivos
  • Auditoria de modelos de terceiros