Cantizare

term_id: quantization

Category: training_techniques

Definition

Cantizarea convertește numerele cu virgulă mobilă de înaltă precizie (cum ar fi FP32) în formate de precizie mai scăzută (cum ar fi INT8 sau FP16). Această reducere scade utilizarea memoriei modelului și cerințele computaționale pentru inferență.

Summary

O tehnică de optimizare a modelului care reduce precizia numerelor utilizate în calculele rețelelor neuronale pentru a diminua dimensiunea și a îmbunătăți viteza.

Key Concepts

  • Reducerea Preciziei
  • Viteza de Inferență
  • Optimizarea Memoriei
  • INT8/FP16

Use Cases

  • Implementare pe Dispozitive Edge
  • Aplicații Mobile AI
  • Inferență în Timp Real

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)