Iniezione di Prompt

term_id: prompt_injection

Category: ethics_safety

Definition

L’iniezione di prompt sfrutta il modo in cui i grandi modelli linguistici interpretano le istruzioni utente, incorporando direttive nascoste o conflittuali nel testo di input. Ciò può indurre il modello a ignorare le sue istruzioni originali o comportamenti sicuri.

Summary

Un attacco avversario in cui input maliziosi manipolano un modello AI per aggirare i filtri di sicurezza o eseguire comandi non previsti.

Key Concepts

  • Attacchi Avversari
  • Prompt di Sistema
  • Rischi per la Sicurezza
  • Sanificazione degli Input

Use Cases

  • Test di Sicurezza LLM
  • Sicurezza dei Chatbot
  • Protezione della Privacy dei Dati