Согласование ИИ

term_id: ai_alignment

Category: ethics_safety

Definition

Согласование ИИ решает проблему обеспечения надежного выполнения искусственным интеллектом того, что пользователи намерены достичь, а не только того, что они буквально указывают. Оно включает технические методы, гарантирующие, что системы ИИ действуют безопасно и этично.

Summary

Область исследований, направленная на обеспечение поведения систем ИИ в соответствии с человеческими ценностями и намерениями.

Key Concepts

  • обучение ценностям
  • полезное поведение
  • проблема контроля
  • интерпретируемость

Use Cases

  • Исследования безопасности больших языковых моделей
  • Разработка функций вознаграждения для RLHF
  • Реализация этических руководств