Compression de modèle

term_id: model_compression

Category: training_techniques

Definition

Cette catégorie inclut des méthodes telles que l’élagage (pruning), la quantification et la distillation de connaissances, visant à réduire l’emprise du modèle tout en maintenant ses performances. Elle est essentielle pour déployer des modèles d’IA complexes

Summary

La compression de modèle désigne les techniques visant à réduire la taille et les exigences computationnelles des modèles d’apprentissage automatique.

Key Concepts

  • Quantification
  • Élagage (Pruning)
  • Distillation de connaissances
  • Vitesse d’inférence

Use Cases

  • Déploiement de modèles sur appareils mobiles
  • Réduction des coûts d’inférence dans le cloud
  • Accélération du traitement vidéo en temps réel

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)