Kvantálás
term_id: quantization
Category: training_techniques
Definition
A kvantálás a magas pontosságú lebegőpontos számokat (pl. FP32) alacsonyabb pontosságú formátumokra (pl. INT8 vagy FP16) konvertálja. Ez a csökkentés csökkenti a modell memóriahasználatát és számítási igényeit
Summary
Egy modelloptimalizálási technika, amely csökkenti a neurális hálózati számításokban használt számok pontosságát a méret csökkentése és a sebesség javítása érdekében.
Key Concepts
- Pontosság csökkentése
- Inferencia sebesség
- Memória optimalizálás
- INT8/FP16
Use Cases
- Peremeszközökön történő telepítés
- Mobil AI alkalmazások
- Valós idejű inferencia
Code Example
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)