Promptinjectie

term_id: prompt_injection

Category: ethics_safety

Definition

Promptinjectie misbruikt de manier waarop grote taalmodellen gebruikersinstructies interpreteren door verborgen of conflicterende richtlijnen in de invoertekst te plaatsen. Dit kan ervoor zorgen dat het model zijn oorspronkelijke instructies negeert.

Summary

Een adversariële aanval waarbij kwaadwillende invoer een AI-model manipuleert om veiligheidsfilters te omzeilen of onbedoelde commando’s uit te voeren.

Key Concepts

  • Adversariële aanvallen
  • Systeemprompts
  • Beveiligingsrisico’s
  • Invoersanitizing

Use Cases

  • Beveiligingstesten voor LLM’s
  • Chatbot-veiligheid
  • Bescherming van gegevensprivacy