Model Compression

term_id: model_compression

Category: training_techniques

Definition

Diese Kategorie umfasst Methoden wie Pruning (Beschneiden), Quantisierung und Knowledge Distillation (Wissensdistillation), die darauf abzielen, den Speicherbedarf des Modells zu verringern, während die Leistung erhalten bleibt. Sie ist entscheidend für die Bereitstellung komplexer KI-Modelle

Summary

Modellkomprimierung bezeichnet Techniken, die die Größe und den Rechenaufwand von Machine-Learning-Modellen reduzieren.

Key Concepts

  • Quantisierung
  • Pruning
  • Knowledge Distillation
  • Inferenzgeschwindigkeit

Use Cases

  • Bereitstellung von Modellen auf Mobilgeräten
  • Reduzierung der Kosten für Cloud-Inferenz
  • Beschleunigung der Echtzeit-Videobearbeitung

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)