Выравнивание
term_id: alignment
Category: ethics_safety
Definition
Выравнивание фокусируется на том, чтобы ИИ-системы делали то, что люди действительно хотят, а не просто то, что они буквально запросят. Это включает такие техники, как обучение с подкреплением по отзывам человека (RLHF) для корректировки поведения модели.
Summary
Процесс обеспечения соответствия целей и поведения ИИ-системы человеческим ценностям и намерениям.
Key Concepts
- RLHF (Обучение с подкреплением по отзывам человека)
- Загрузка ценностей
- Соответствие намерениям
- Моделирование вознаграждения
Use Cases
- Настройка чат-ботов на вежливость
- Обеспечение фактической точности в резюме
- Предотвращение эксплуатации уязвимостей (jailbreak)