Выравнивание

term_id: alignment

Category: ethics_safety

Definition

Выравнивание фокусируется на том, чтобы ИИ-системы делали то, что люди действительно хотят, а не просто то, что они буквально запросят. Это включает такие техники, как обучение с подкреплением по отзывам человека (RLHF) для корректировки поведения модели.

Summary

Процесс обеспечения соответствия целей и поведения ИИ-системы человеческим ценностям и намерениям.

Key Concepts

  • RLHF (Обучение с подкреплением по отзывам человека)
  • Загрузка ценностей
  • Соответствие намерениям
  • Моделирование вознаграждения

Use Cases

  • Настройка чат-ботов на вежливость
  • Обеспечение фактической точности в резюме
  • Предотвращение эксплуатации уязвимостей (jailbreak)