Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Beim Jailbreaking werden spezifische Eingaben oder Prompts so formuliert, dass ein KI-Modell dazu gebracht wird, seine eingebauten Sicherheitsrichtlinien zu ignorieren und verbotene Inhalte zu generieren, wie z. B. Hassrede oder gefährliche Anweisungen.

Summary

Eine Technik des Prompt-Engineering, die darauf abzielt, die Sicherheitsfilter und ethischen Einschränkungen eines KI-Modells zu umgehen.

Key Concepts

  • Prompt-Injection
  • Sicherheitsfilter
  • Red Teaming
  • Alignment

Use Cases

  • Tests in der Sicherheitsforschung
  • Bösartige Generierung schädlicher Inhalte
  • Bewertung der Robustheit von Modellen