Model Compression

term_id: model_compression

Category: training_techniques

Definition

Denne kategorien inkluderer metoder som pruning, kvantisering og kunnskapsdistillasjon, som har til formål å redusere modellens fotavtrykk samtidig som ytelsen opprettholdes. Det er essensielt for å distribuere komplekse AI-modeller

Summary

Modellkomprimering refererer til teknikker som reduserer størrelsen og de beregningsmessige kravene til maskinlæringsmodeller.

Key Concepts

  • Kvantisering
  • Pruning
  • Kunnskapsdistillasjon
  • Inferenstakt

Use Cases

  • Distribusjon av modeller på mobile enheter
  • Reduksjon av sky-inferenskostnader
  • Akselerering av sanntids videobehandling

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)