Дистилляция знаний
term_id: distillation
Category: training_techniques
Definition
Этот процесс включает передачу знаний от сложной высокопроизводительной нейронной сети «учителя» к более простой и эффективной сети «студента». Студент учится не только на жестких метках (hard labels), но и на мягких вероятностных распределениях, извлеченных из учителя.
Summary
Дистилляция знаний — это техника сжатия модели, при которой меньшая модель-студент обучается имитировать поведение более крупной модели-учителя.
Key Concepts
- Архитектура Учитель-Студент
- Мягкие таргеты (Soft Targets)
- Сжатие модели
- Эффективность вывода (Inference Efficiency)
Use Cases
- Развертывание больших языковых моделей на мобильных устройствах
- Снижение задержки в приложениях компьютерного зрения реального времени
- Оптимизация моделей глубокого обучения для сред периферийных вычислений (edge computing)