Iniezione di Prompt
term_id: prompt_injection
Category: ethics_safety
Definition
L’iniezione di prompt sfrutta il modo in cui i grandi modelli linguistici interpretano le istruzioni utente, incorporando direttive nascoste o conflittuali nel testo di input. Ciò può indurre il modello a ignorare le sue istruzioni originali o comportamenti sicuri.
Summary
Un attacco avversario in cui input maliziosi manipolano un modello AI per aggirare i filtri di sicurezza o eseguire comandi non previsti.
Key Concepts
- Attacchi Avversari
- Prompt di Sistema
- Rischi per la Sicurezza
- Sanificazione degli Input
Use Cases
- Test di Sicurezza LLM
- Sicurezza dei Chatbot
- Protezione della Privacy dei Dati