Alignement
term_id: alignment
Category: ethics_safety
Definition
L’alignement vise à faire en sorte que les systèmes d’IA fassent ce que les humains veulent réellement, et pas seulement ce qu’ils demandent littéralement. Il implique des techniques telles que l’apprentissage par renforcement à partir de retours humains (RLHF) pour ajuster les comportements.
Summary
Le processus consistant à s’assurer que les objectifs et les comportements d’un système d’IA correspondent aux valeurs et aux intentions humaines.
Key Concepts
- RLHF (Apprentissage par renforcement à partir de retours humains)
- Chargement de valeurs
- Correspondance des intentions
- Modélisation de la récompense
Use Cases
- Réglage des chatbots pour la politesse
- Garantie de l’exactitude factuelle dans les résumés
- Prévention des failles de sécurité (jailbreak)