Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Le jailbreak consiste à concevoir des entrées ou des prompts spécifiques pour tromper un modèle d’IA afin qu’il ignore ses directives de sécurité intégrées et génère du contenu interdit, tel que des discours de haine ou des instructions dangereuses.
Summary
Une technique d’ingénierie de prompt conçue pour contourner les filtres de sécurité et les contraintes éthiques d’un modèle d’IA.
Key Concepts
- Injection de prompt
- Filtres de sécurité
- Test d’intrusion (Red Teaming)
- Alignement
Use Cases
- Tests de recherche en sécurité
- Génération malveillante de contenu nuisible
- Évaluation de la robustesse des modèles