Wstrzykiwanie promptów

term_id: prompt_injection

Category: ethics_safety

Definition

Wstrzykiwanie promptów wykorzystuje sposób, w jaki duże modele językowe interpretują instrukcje użytkowników, poprzez ukrywanie sprzecznych lub dodatkowych dyrektyw w tekście wejściowym. Może to spowodować, że model zignoruje swoje oryginalne wytyczne bezpieczeństwa i wykona polecenie atakującego.

Summary

Atak adversarialny, w którym złośliwe dane manipulują modelem AI w celu obejścia filtrów bezpieczeństwa lub wykonania nieprzewidzianych poleceń.

Key Concepts

  • Ataki adversarialne
  • Systemowe prompty (System Prompts)
  • Ryzyka bezpieczeństwa
  • Sanityzacja danych wejściowych

Use Cases

  • Testowanie bezpieczeństwa LLM
  • Bezpieczeństwo chatbotów
  • Ochrona prywatności danych