Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbreak polega na tworzeniu specyficznych wejść lub promptów, które oszukują model AI, aby zignorował wbudowane wytyczne bezpieczeństwa i generował zabronioną treść, taką jak mowa nienawiści czy niebezpieczne instrukcje.

Summary

Technika inżynierii promptów mająca na celu obejście filtrów bezpieczeństwa i ograniczeń etycznych modelu AI.

Key Concepts

  • Iniekcja promptu
  • Filtry bezpieczeństwa
  • Testowanie czerwonego zespołu
  • Wyrównanie

Use Cases

  • Testy badań bezpieczeństwa
  • Maliciouszne generowanie szkodliwych treści
  • Ocena odporności modelu