Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Jailbreaking indebærer at udforme specifikke input eller prompts, der narre en AI-model til at ignorere sine indbyggede sikkerhedsretningslinjer og generere forbudt indhold, såsom hadefuldt sprog eller farlige instruktioner.
Summary
En teknik inden for prompt-engineering designet til at omgå en AI-modells sikkerhedsfiltre og etiske begrænsninger.
Key Concepts
- Prompt-injektion
- Sikkerhedsfiltre
- Red Teaming
- Alignment (Justering)
Use Cases
- Test af sikkerhedsforskning
- Maliciøs generering af skadeligt indhold
- Vurdering af modellens robusthed