Distillation
term_id: distillation
Category: training_techniques
Definition
Denna process innebär att överföra kunskap från ett komplext, högpresterande ’lärar’-neuronätverk till ett enklare och mer effektivt ‘student’-nätverk. Studenten lär sig inte bara av hårda etiketter (hard labels) utan även av de mjuka sannolikhetsfördelningar som läraren producerar, vilket möjliggör bevarandet av mer information än vad klassiska etiketter ger.
Summary
Kunskapsdistillation är en teknik för modellkomprimering där en mindre ‘studentmodell’ lär sig att efterlikna beteendet hos en större ’lärarmodell’.
Key Concepts
- Lärar-Student-arkitektur
- Mjuka målvärden (Soft Targets)
- Modellkomprimering
- Effektiv inferens
Use Cases
- Att distribuera stora språkmodeller på mobila enheter
- Att minska latens i realtidsapplikationer för datorseende
- Att optimera djupinlärningsmodeller för miljöer med kantberäkning (edge computing)