Inyección de Prompt

term_id: prompt_injection

Category: ethics_safety

Definition

La inyección de prompt explota la forma en que los grandes modelos de lenguaje interpretan las instrucciones del usuario, incrustando directivas ocultas o conflictivas dentro del texto de entrada. Esto puede hacer que el modelo ignore sus instrucciones originales o compromisos de seguridad.

Summary

Un ataque adversarial donde entradas maliciosas manipulan un modelo de IA para eludir filtros de seguridad o ejecutar comandos no previstos.

Key Concepts

  • Ataques Adversariales
  • Prompts del Sistema
  • Riesgos de Seguridad
  • Sanitización de Entradas

Use Cases

  • Pruebas de Seguridad de LLM
  • Seguridad de Chatbots
  • Protección de Privacidad de Datos