Model Compression

term_id: model_compression

Category: training_techniques

Definition

Denna kategori inkluderar metoder som beskärning, kvantisering och kunskapsdistillation, syftande till att krympa modellens fotavtryck samtidigt som prestandan upprätthålls. Det är avgörande för att distribuera komplexa AI-modeller

Summary

Modellkomprimering avser tekniker som minskar storleken och de beräkningsmässiga kraven för maskininlärningsmodeller.

Key Concepts

  • Kvantisering
  • Beskärning
  • Kunskapsdistillation
  • Inferenshastighet

Use Cases

  • Distribution av modeller på mobila enheter
  • Minskning av kostnader för molninferens
  • Accelerering av videobearbetning i realtid

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)