Injecție de Prompt

term_id: prompt_injection

Category: ethics_safety

Definition

Injecția de prompt exploatează modul în care modelele lingvistice mari interpretează instrucțiunile utilizatorului, integrând directive ascunse sau conflictuale în textul de intrare. Acest lucru poate determina modelul să ignore instrucțiunile sale originale de sistem.

Summary

Un atac adversarial în care intrările malitioase manipulează un model AI pentru a ocoli filtrele de siguranță sau a executa comenzi neintenționate.

Key Concepts

  • Atacuri Adversariale
  • Prompturi de Sistem
  • Riscuri de Securitate
  • Sanitizarea Intrărilor

Use Cases

  • Testarea Securității LLM
  • Siguranța Chatbot-urilor
  • Protecția Confidențialității Datelor