Quantização

term_id: quantization

Category: training_techniques

Definition

A quantização converte números de ponto flutuante de alta precisão (como FP32) em formatos de menor precisão (como INT8 ou FP16). Essa redução diminui o uso de memória do modelo e os requisitos computacionais…

Summary

Uma técnica de otimização de modelos que reduz a precisão dos números usados nos cálculos de redes neurais para diminuir o tamanho e melhorar a velocidade.

Key Concepts

  • Redução de Precisão
  • Velocidade de Inferência
  • Otimização de Memória
  • INT8/FP16

Use Cases

  • Implantação em Dispositivos de Borda
  • Aplicações de IA Móvel
  • Inferência em Tempo Real

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)