Kwantyzacja

term_id: quantization

Category: training_techniques

Definition

Kwantyzacja przekształca liczby zmiennoprzecinkowe wysokiej precyzji (np. FP32) w formaty niższej precyzji (np. INT8 lub FP16). Ta redukcja zmniejsza zużycie pamięci modelu oraz wymagania obliczeniowe, umożliwiając szybsze wnioskowanie (inference) bez istotnej utraty dokładności.

Summary

Technika optymalizacji modelu, która zmniejsza precyzję liczb używanych w obliczeniach sieci neuronowych, aby zmniejszyć rozmiar modelu i zwiększyć prędkość działania.

Key Concepts

  • Redukcja precyzji
  • Prędkość wnioskowania (Inference Speed)
  • Optymalizacja pamięci
  • INT8/FP16

Use Cases

  • Wdrożenia na urządzeniach brzegowych (Edge Devices)
  • Aplikacje mobilne AI
  • Wnioskowanie w czasie rzeczywistym

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)