Distillation

term_id: distillation

Category: training_techniques

Definition

Denna process innebär att överföra kunskap från ett komplext, högpresterande ’lärar’-neuronätverk till ett enklare och mer effektivt ‘student’-nätverk. Studenten lär sig inte bara av hårda etiketter (hard labels) utan även av de mjuka sannolikhetsfördelningar som läraren producerar, vilket möjliggör bevarandet av mer information än vad klassiska etiketter ger.

Summary

Kunskapsdistillation är en teknik för modellkomprimering där en mindre ‘studentmodell’ lär sig att efterlikna beteendet hos en större ’lärarmodell’.

Key Concepts

  • Lärar-Student-arkitektur
  • Mjuka målvärden (Soft Targets)
  • Modellkomprimering
  • Effektiv inferens

Use Cases

  • Att distribuera stora språkmodeller på mobila enheter
  • Att minska latens i realtidsapplikationer för datorseende
  • Att optimera djupinlärningsmodeller för miljöer med kantberäkning (edge computing)