Prompt-Injection

term_id: prompt_injection

Category: ethics_safety

Definition

Prompt-Injection nutzt die Weise aus, wie Large Language Models (LLMs) Benutzeraufforderungen interpretieren, indem versteckte oder widersprüchliche Anweisungen in den Eingabetext eingebettet werden. Dies kann dazu führen, dass das Modell seine ursprünglichen Anweisungen ignoriert.

Summary

Ein Angriff, bei dem bösartige Eingaben ein KI-Modell manipulieren, um Sicherheitsfilter zu umgehen oder unbeabsichtigte Befehle auszuführen.

Key Concepts

  • Adversariale Angriffe
  • System-Prompts
  • Sicherheitsrisiken
  • Bereinigung der Eingaben

Use Cases

  • Sicherheitstests für LLMs
  • Chatbot-Sicherheit
  • Datenschutz