Kvantálás

term_id: quantization

Category: training_techniques

Definition

A kvantálás a magas pontosságú lebegőpontos számokat (pl. FP32) alacsonyabb pontosságú formátumokra (pl. INT8 vagy FP16) konvertálja. Ez a csökkentés csökkenti a modell memóriahasználatát és számítási igényeit

Summary

Egy modelloptimalizálási technika, amely csökkenti a neurális hálózati számításokban használt számok pontosságát a méret csökkentése és a sebesség javítása érdekében.

Key Concepts

  • Pontosság csökkentése
  • Inferencia sebesség
  • Memória optimalizálás
  • INT8/FP16

Use Cases

  • Peremeszközökön történő telepítés
  • Mobil AI alkalmazások
  • Valós idejű inferencia

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)