Обучение предпочтениям
term_id: preference_learning
Category: training_techniques
Definition
Обучение предпочтениям сосредоточено на обучении моделей различать хорошие и плохие выходные данные на основе суждений человека, а не абсолютных меток. Обычно оно включает сбор пар ответов, где один ответ считается предпочтительнее другого, что позволяет модели формировать функцию вознаграждения, отражающую человеческие ценности и вкусы.
Summary
Техника, обучающая модели согласовывать выходные данные с человеческими предпочтениями с использованием сравнительной обратной связи.
Key Concepts
- Человеческая обратная связь
- Парное сравнение
- Моделирование вознаграждения
- Выравнивание (Alignment)
Use Cases
- RLHF для больших языковых моделей
- Рекомендательные системы
- Фильтрация контента и модерация