Cercas de seguridad

term_id: guardrails

Category: application_paradigms

Definition

Las cercas de seguridad se refieren a un conjunto de controles de software y capas de aplicación de políticas integradas en las aplicaciones de IA, particularmente en los modelos de lenguaje grandes, para garantizar un comportamiento seguro y conforme a la normativa. Actúan como filtros que impiden que el modelo genere respuestas inapropiadas o peligrosas.

Summary

Mecanismos de seguridad diseñados para restringir las salidas del modelo de IA con el fin de prevenir la generación de contenido dañino, sesgado o no autorizado.

Key Concepts

  • Filtrado de entrada/salida
  • Aplicación de políticas
  • Detección de toxicidad
  • Defensa contra inyección de prompts

Use Cases

  • Chatbots empresariales que requieren una estricta conformidad de marca
  • Asistentes de salud que garantizan precisión médica y privacidad
  • Bots de atención al cliente que previenen el uso de lenguaje ofensivo