Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbreaking involverer å lage spesifikke inndata eller prompts som lurer en AI-modell til å ignorere innebygde sikkerhetsretningslinjer og generere forbudt innhold, som hatprat eller farlige instruksjoner.

Summary

En teknikk for prompt-engineering designet for å omgå sikkerhetsfilter og etiske begrensninger i en AI-modell.

Key Concepts

  • Prompt Injection
  • Sikkerhetsfilter
  • Red Teaming
  • Alignment

Use Cases

  • Testing av sikkerhetsforskning
  • Malicious generering av skadelig innhold
  • Vurdering av modellens robusthet