Alignement

term_id: alignment

Category: ethics_safety

Definition

L’alignement vise à faire en sorte que les systèmes d’IA fassent ce que les humains veulent réellement, et pas seulement ce qu’ils demandent littéralement. Il implique des techniques telles que l’apprentissage par renforcement à partir de retours humains (RLHF) pour ajuster les comportements.

Summary

Le processus consistant à s’assurer que les objectifs et les comportements d’un système d’IA correspondent aux valeurs et aux intentions humaines.

Key Concepts

  • RLHF (Apprentissage par renforcement à partir de retours humains)
  • Chargement de valeurs
  • Correspondance des intentions
  • Modélisation de la récompense

Use Cases

  • Réglage des chatbots pour la politesse
  • Garantie de l’exactitude factuelle dans les résumés
  • Prévention des failles de sécurité (jailbreak)