Quantizzazione
term_id: quantization
Category: training_techniques
Definition
La quantizzazione converte numeri floating-point ad alta precisione (come FP32) in formati a minore precisione (come INT8 o FP16). Questa riduzione diminuisce l’utilizzo di memoria del modello e i requisiti computazionali, accelerando l’inferenza.
Summary
Una tecnica di ottimizzazione del modello che riduce la precisione dei numeri utilizzati nei calcoli delle reti neurali per diminuirne le dimensioni e migliorare la velocità.
Key Concepts
- Riduzione della Precisione
- Velocità di Inferenza
- Ottimizzazione della Memoria
- INT8/FP16
Use Cases
- Deploy su Dispositivi Edge
- Applicazioni AI Mobile
- Inferenza in Tempo Reale
Code Example
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)