Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Jailbreak polega na tworzeniu specyficznych wejść lub promptów, które oszukują model AI, aby zignorował wbudowane wytyczne bezpieczeństwa i generował zabronioną treść, taką jak mowa nienawiści czy niebezpieczne instrukcje.
Summary
Technika inżynierii promptów mająca na celu obejście filtrów bezpieczeństwa i ograniczeń etycznych modelu AI.
Key Concepts
- Iniekcja promptu
- Filtry bezpieczeństwa
- Testowanie czerwonego zespołu
- Wyrównanie
Use Cases
- Testy badań bezpieczeństwa
- Maliciouszne generowanie szkodliwych treści
- Ocena odporności modelu