Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbreaking indebærer at udforme specifikke input eller prompts, der narre en AI-model til at ignorere sine indbyggede sikkerhedsretningslinjer og generere forbudt indhold, såsom hadefuldt sprog eller farlige instruktioner.

Summary

En teknik inden for prompt-engineering designet til at omgå en AI-modells sikkerhedsfiltre og etiske begrænsninger.

Key Concepts

  • Prompt-injektion
  • Sikkerhedsfiltre
  • Red Teaming
  • Alignment (Justering)

Use Cases

  • Test af sikkerhedsforskning
  • Maliciøs generering af skadeligt indhold
  • Vurdering af modellens robusthed