Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Jailbroken betreft het creëren van specifieke invoer of prompts die een AI-model ertoe brengen zijn ingebouwde veiligheidsrichtlijnen te negeren en verboden inhoud te genereren, zoals haatzaaiende taal of gevaarlijke instructies.
Summary
Een techniek voor prompt-engineering die is ontworpen om de veiligheidsfilters en ethische beperkingen van een AI-model te omzeilen.
Key Concepts
- Prompt-injectie
- Veiligheidsfilters
- Red Teaming
- Alignement
Use Cases
- Testen van beveiligingsonderzoek
- Malicieus genereren van schadelijke inhoud
- Evalueren van modelrobustheid