Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Jailbreaking involverer å lage spesifikke inndata eller prompts som lurer en AI-modell til å ignorere innebygde sikkerhetsretningslinjer og generere forbudt innhold, som hatprat eller farlige instruksjoner.
Summary
En teknikk for prompt-engineering designet for å omgå sikkerhetsfilter og etiske begrensninger i en AI-modell.
Key Concepts
- Prompt Injection
- Sikkerhetsfilter
- Red Teaming
- Alignment
Use Cases
- Testing av sikkerhetsforskning
- Malicious generering av skadelig innhold
- Vurdering av modellens robusthet