Дистилляция знаний

term_id: distillation

Category: training_techniques

Definition

Этот процесс включает передачу знаний от сложной высокопроизводительной нейронной сети «учителя» к более простой и эффективной сети «студента». Студент учится не только на жестких метках (hard labels), но и на мягких вероятностных распределениях, извлеченных из учителя.

Summary

Дистилляция знаний — это техника сжатия модели, при которой меньшая модель-студент обучается имитировать поведение более крупной модели-учителя.

Key Concepts

  • Архитектура Учитель-Студент
  • Мягкие таргеты (Soft Targets)
  • Сжатие модели
  • Эффективность вывода (Inference Efficiency)

Use Cases

  • Развертывание больших языковых моделей на мобильных устройствах
  • Снижение задержки в приложениях компьютерного зрения реального времени
  • Оптимизация моделей глубокого обучения для сред периферийных вычислений (edge computing)