Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

O jailbreaking envolve criar entradas ou prompts específicos que enganam o modelo de IA para que ignore suas diretrizes de segurança embutidas e gere conteúdo proibido, como discurso de ódio, instruções perigosas ou informações sensíveis. É uma técnica usada tanto por pesquisadores de segurança para testar robustez quanto por usuários mal-intencionados para explorar vulnerabilidades.

Summary

Uma técnica de engenharia de prompt projetada para contornar os filtros de segurança e as restrições éticas de um modelo de IA.

Key Concepts

  • Injeção de Prompt
  • Filtros de Segurança
  • Teste de Penetração (Red Teaming)
  • Alinhamento

Use Cases

  • Testes de pesquisa em segurança
  • Geração maliciosa de conteúdo prejudicial
  • Avaliação da robustez do modelo