Model Compression

term_id: model_compression

Category: training_techniques

Definition

Questa categoria include metodi come la potatura (pruning), la quantizzazione e la distillazione della conoscenza, mirati a ridurre l’impronta del modello mantenendo le prestazioni. È essenziale per distribuire modelli AI complessi

Summary

La compressione del modello si riferisce a tecniche che riducono le dimensioni e i requisiti computazionali dei modelli di apprendimento automatico.

Key Concepts

  • Quantizzazione
  • Potatura (Pruning)
  • Distillazione della conoscenza
  • Velocità di inferenza

Use Cases

  • Distribuzione di modelli su dispositivi mobili
  • Riduzione dei costi di inferenza nel cloud
  • Accelerazione dell’elaborazione video in tempo reale

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)