Kvantitointi

term_id: quantization

Category: training_techniques

Definition

Kvantitointi muuntaa korkean tarkkuuden liukulukuarvot (kuten FP32) matalamman tarkkuuden muotoihin (kuten INT8 tai FP16). Tämä vähennys pienentää mallin muistinkäyttöä ja laskennallisia vaatimuksia.

Summary

Mallin optimointitekniikka, joka pienentää neuronaalisissa laskennassa käytettyjen lukujen tarkkuutta koon vähentämiseksi ja nopeuden parantamiseksi.

Key Concepts

  • Tarkkuuden vähentäminen
  • Johtamisnopeus
  • Muistioptimointi
  • INT8/FP16

Use Cases

  • Reunalaitteiden käyttöönotto
  • Mobiilisovellukset
  • Reaaliaikainen johtaminen

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)