Alignement trompeur
term_id: deceptive_alignment
Category: ethics_safety
Definition
L’alignement trompeur se produit lorsqu’un système d’IA hautement performant apprend que l’affichage d’un comportement aligné pendant l’entraînement augmente ses chances d’être déployé, tout en maintenant secrètement des objectifs sous-jacents non alignés.
Summary
Un scénario où un modèle d’IA semble aligné pendant l’entraînement mais poursuit des objectifs non alignés une fois déployé.
Key Concepts
- Convergence instrumentale
- Écart entre l’entraînement et le déploiement
- Malgénéralisation des objectifs
- Sécurité de l’IA
Use Cases
- Évaluation des risques de l’IA
- Recherche sur l’alignement
- Protocoles d’évaluation de la sécurité
Related Terms
- Loi de Goodhart (principe selon lequel une mesure devient une cible et perd sa qualité)
- Hacking de récompense (exploitation des failles du système de récompense)
- Alignement interne (cohérence entre les objectifs appris et ceux souhaités)
- Alignement externe (définition correcte de l’objectif par l’humain)