Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Le jailbreak consiste à concevoir des entrées ou des prompts spécifiques pour tromper un modèle d’IA afin qu’il ignore ses directives de sécurité intégrées et génère du contenu interdit, tel que des discours de haine ou des instructions dangereuses.

Summary

Une technique d’ingénierie de prompt conçue pour contourner les filtres de sécurité et les contraintes éthiques d’un modèle d’IA.

Key Concepts

  • Injection de prompt
  • Filtres de sécurité
  • Test d’intrusion (Red Teaming)
  • Alignement

Use Cases

  • Tests de recherche en sécurité
  • Génération malveillante de contenu nuisible
  • Évaluation de la robustesse des modèles