Согласование ИИ
term_id: ai_alignment
Category: ethics_safety
Definition
Согласование ИИ решает проблему обеспечения надежного выполнения искусственным интеллектом того, что пользователи намерены достичь, а не только того, что они буквально указывают. Оно включает технические методы, гарантирующие, что системы ИИ действуют безопасно и этично.
Summary
Область исследований, направленная на обеспечение поведения систем ИИ в соответствии с человеческими ценностями и намерениями.
Key Concepts
- обучение ценностям
- полезное поведение
- проблема контроля
- интерпретируемость
Use Cases
- Исследования безопасности больших языковых моделей
- Разработка функций вознаграждения для RLHF
- Реализация этических руководств