Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbroken betreft het creëren van specifieke invoer of prompts die een AI-model ertoe brengen zijn ingebouwde veiligheidsrichtlijnen te negeren en verboden inhoud te genereren, zoals haatzaaiende taal of gevaarlijke instructies.

Summary

Een techniek voor prompt-engineering die is ontworpen om de veiligheidsfilters en ethische beperkingen van een AI-model te omzeilen.

Key Concepts

  • Prompt-injectie
  • Veiligheidsfilters
  • Red Teaming
  • Alignement

Use Cases

  • Testen van beveiligingsonderzoek
  • Malicieus genereren van schadelijke inhoud
  • Evalueren van modelrobustheid