Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbreaking involves crafting specific inputs or prompts that trick an AI model into ignoring its built-in safety guidelines and generating prohibited content, such as hate speech, dangerous instructions, or private information. Attackers often use role-playing, obfuscation, or logical paradoxes to exploit vulnerabilities in the model’s alignment. Detecting and preventing jailbreaks is a major challenge in AI safety, requiring robust red-teaming and continuous updates to safety filters to maintain responsible behavior.

Summary

A prompt engineering technique designed to bypass an AI model’s safety filters and ethical constraints.

Key Concepts

  • Prompt Injection
  • Safety Filters
  • Red Teaming
  • Alignment

Use Cases

  • Security research testing
  • Generating harmful content maliciously
  • Evaluating model robustness