Quantizzazione

term_id: quantization

Category: training_techniques

Definition

La quantizzazione converte numeri floating-point ad alta precisione (come FP32) in formati a minore precisione (come INT8 o FP16). Questa riduzione diminuisce l’utilizzo di memoria del modello e i requisiti computazionali, accelerando l’inferenza.

Summary

Una tecnica di ottimizzazione del modello che riduce la precisione dei numeri utilizzati nei calcoli delle reti neurali per diminuirne le dimensioni e migliorare la velocità.

Key Concepts

  • Riduzione della Precisione
  • Velocità di Inferenza
  • Ottimizzazione della Memoria
  • INT8/FP16

Use Cases

  • Deploy su Dispositivi Edge
  • Applicazioni AI Mobile
  • Inferenza in Tempo Reale

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)