Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Beim Jailbreaking werden spezifische Eingaben oder Prompts so formuliert, dass ein KI-Modell dazu gebracht wird, seine eingebauten Sicherheitsrichtlinien zu ignorieren und verbotene Inhalte zu generieren, wie z. B. Hassrede oder gefährliche Anweisungen.
Summary
Eine Technik des Prompt-Engineering, die darauf abzielt, die Sicherheitsfilter und ethischen Einschränkungen eines KI-Modells zu umgehen.
Key Concepts
- Prompt-Injection
- Sicherheitsfilter
- Red Teaming
- Alignment
Use Cases
- Tests in der Sicherheitsforschung
- Bösartige Generierung schädlicher Inhalte
- Bewertung der Robustheit von Modellen