קוונטיזציה

term_id: quantization

Category: training_techniques

Definition

קוונטיזציה ממירה מספרי נקודה צפה בדיוק גבוה (כמו FP32) לפורמטים בדיוק נמוך יותר (כמו INT8 או FP16). הפחתה זו מקטינה את השימוש בזיכרון ואת הדרישות החישוביות של המודל.

Summary

טכניקת אופטימיזציה של מודל המפחיתה את דיוק המספרים המשמשים בחישובי רשתות נוירונים כדי להקטין את גודל המודל ולשפר את המהירות.

Key Concepts

  • הפחתת דיוק
  • מהירות הסקה
  • אופטימיזציה של זיכרון
  • INT8/FP16

Use Cases

  • פריסה במכשירי קצה
  • יישומי AI ניידים
  • הסקה בזמן אמת

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)