Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
O jailbreaking envolve criar entradas ou prompts específicos que enganam o modelo de IA para que ignore suas diretrizes de segurança embutidas e gere conteúdo proibido, como discurso de ódio, instruções perigosas ou informações sensíveis. É uma técnica usada tanto por pesquisadores de segurança para testar robustez quanto por usuários mal-intencionados para explorar vulnerabilidades.
Summary
Uma técnica de engenharia de prompt projetada para contornar os filtros de segurança e as restrições éticas de um modelo de IA.
Key Concepts
- Injeção de Prompt
- Filtros de Segurança
- Teste de Penetração (Red Teaming)
- Alinhamento
Use Cases
- Testes de pesquisa em segurança
- Geração maliciosa de conteúdo prejudicial
- Avaliação da robustez do modelo
Related Terms
- Injeção de Prompt (inserção de comandos maliciosos em entradas de texto)
- Ataque Adversarial (modificações sutis nos dados de entrada para enganar o modelo)
- Alinhamento (ajustar o modelo para seguir intenções e valores humanos)
- Red Teaming (equipe dedicada a encontrar falhas de segurança em sistemas de IA)