Distillation

term_id: distillation

Category: training_techniques

Definition

Dieser Prozess beinhaltet die Übertragung von Wissen von einem komplexen, hochleistungsfähigen ‘Lehrer’-Neuronalen Netzwerk auf ein einfacheres, effizienteres ‘Schüler’-Netzwerk. Der Schüler lernt nicht nur aus harten Labels, sondern auch aus den weichen Wahrscheinlichkeitsverteilungen des Lehrers.

Summary

Knowledge Distillation ist eine Modellkomprimierungstechnik, bei der ein kleineres Schülermodell das Verhalten eines größeren Lehrmodells nachahmt.

Key Concepts

  • Lehrer-Schüler-Architektur
  • Weiche Ziele (Soft Targets)
  • Modellkomprimierung
  • Effizienz bei der Inferenz

Use Cases

  • Bereitstellung großer Sprachmodelle auf mobilen Geräten
  • Reduzierung der Latenz in Echtzeit-Computer-Vision-Anwendungen
  • Optimierung von Deep-Learning-Modellen für Edge-Computing-Umgebungen