Promptinjectie
term_id: prompt_injection
Category: ethics_safety
Definition
Promptinjectie misbruikt de manier waarop grote taalmodellen gebruikersinstructies interpreteren door verborgen of conflicterende richtlijnen in de invoertekst te plaatsen. Dit kan ervoor zorgen dat het model zijn oorspronkelijke instructies negeert.
Summary
Een adversariële aanval waarbij kwaadwillende invoer een AI-model manipuleert om veiligheidsfilters te omzeilen of onbedoelde commando’s uit te voeren.
Key Concepts
- Adversariële aanvallen
- Systeemprompts
- Beveiligingsrisico’s
- Invoersanitizing
Use Cases
- Beveiligingstesten voor LLM’s
- Chatbot-veiligheid
- Bescherming van gegevensprivacy