Nicelleme

term_id: quantization

Category: training_techniques

Definition

Nicelleme, yüksek hassasiyetli kayan nokta sayılarını (örneğin FP32) daha düşük hassasiyetli formatlara (örneğin INT8 veya FP16) dönüştürür. Bu azalma, modelin bellek kullanımını ve hesaplama gereksinimlerini düşürür, böylece modelin dağıtımını ve çıkarımını hızlandırır.

Summary

Sinir ağı hesaplamalarında kullanılan sayıların hassasiyetini azaltarak model boyutunu küçültmek ve hızı artırmayı amaçlayan bir model optimizasyon tekniğidir.

Key Concepts

  • Hassasiyet Azaltma
  • Çıkarım Hızı
  • Bellek Optimizasyonu
  • INT8/FP16

Use Cases

  • Uç Cihaz Dağıtımı
  • Mobil Yapay Zeka Uygulamaları
  • Gerçek Zamanlı Çıkarım

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)