Ataque de Porta dos Fundos
term_id: backdoor_attack
Category: ethics_safety
Definition
Um ataque de porta dos fundos envolve envenenar os dados de treinamento de um modelo de aprendizado de máquina com padrões específicos, conhecidos como gatilhos. Embora o modelo funcione normalmente em dados limpos, ele ativa comportamentos incorretos quando o gatilho é detectado, permitindo que atacantes controlem a saída do modelo.
Summary
Uma ameaça de segurança na qual agentes mal-intencionados inserem gatilhos ocultos em modelos de IA durante o treinamento para causar classificações específicas incorretas.
Key Concepts
- Envenenamento de Dados
- Integridade do Modelo
- Aprendizado de Máquina Adversarial
- Padrões de Gatilho
Use Cases
- Testes de segurança de pipelines de ML
- Desenvolvimento de filtros defensivos
- Auditoria de modelos de terceiros