Alignement de l'IA
term_id: ai_alignment
Category: ethics_safety
Definition
L’alignement de l’IA traite du défi consistant à rendre les systèmes d’intelligence artificielle robustes dans l’exécution de ce que leurs utilisateurs ont réellement l’intention de faire, plutôt que ce qu’ils spécifient littéralement. Cela implique des méthodes techniques pour assurer que les systèmes respectent les normes éthiques et les objectifs humains.
Summary
Le domaine d’étude axé sur la garantie que les systèmes IA se comportent conformément aux valeurs et aux intentions humaines.
Key Concepts
- apprentissage des valeurs
- comportement bénéfique
- problème du contrôle
- interprétabilité
Use Cases
- Recherche sur la sécurité des grands modèles de langage
- Développement de fonctions de récompense pour le RLHF
- Mise en œuvre de lignes directrices éthiques