Обучение предпочтениям

term_id: preference_learning

Category: training_techniques

Definition

Обучение предпочтениям сосредоточено на обучении моделей различать хорошие и плохие выходные данные на основе суждений человека, а не абсолютных меток. Обычно оно включает сбор пар ответов, где один ответ считается предпочтительнее другого, что позволяет модели формировать функцию вознаграждения, отражающую человеческие ценности и вкусы.

Summary

Техника, обучающая модели согласовывать выходные данные с человеческими предпочтениями с использованием сравнительной обратной связи.

Key Concepts

  • Человеческая обратная связь
  • Парное сравнение
  • Моделирование вознаграждения
  • Выравнивание (Alignment)

Use Cases

  • RLHF для больших языковых моделей
  • Рекомендательные системы
  • Фильтрация контента и модерация