Prompt-injeksjon

term_id: prompt_injection

Category: ethics_safety

Definition

Prompt-injeksjon utnytter måten store språkmodeller tolker brukerinstruksjoner ved å gjemme skjulte eller motstridende direktiver i inputteksten. Dette kan få modellen til å ignorere sine opprinnelige sikkerhetsretningslinjer.

Summary

Et fiendtlig angrep der skadelige input manipulerer en AI-modell for å omgå sikkerhetsfilter eller utføre uønskede kommandoer.

Key Concepts

  • Fiendtlige angrep (Adversarial Attacks)
  • Systemprompter
  • Sikkerhetsrisikoer
  • Input-sanitisering

Use Cases

  • Sikkerhetstesting av LLM-er
  • Chatbot-sikkerhet
  • Beskyttelse av personvern