Wstrzykiwanie promptów
term_id: prompt_injection
Category: ethics_safety
Definition
Wstrzykiwanie promptów wykorzystuje sposób, w jaki duże modele językowe interpretują instrukcje użytkowników, poprzez ukrywanie sprzecznych lub dodatkowych dyrektyw w tekście wejściowym. Może to spowodować, że model zignoruje swoje oryginalne wytyczne bezpieczeństwa i wykona polecenie atakującego.
Summary
Atak adversarialny, w którym złośliwe dane manipulują modelem AI w celu obejścia filtrów bezpieczeństwa lub wykonania nieprzewidzianych poleceń.
Key Concepts
- Ataki adversarialne
- Systemowe prompty (System Prompts)
- Ryzyka bezpieczeństwa
- Sanityzacja danych wejściowych
Use Cases
- Testowanie bezpieczeństwa LLM
- Bezpieczeństwo chatbotów
- Ochrona prywatności danych