Kvantisering

term_id: quantization

Category: training_techniques

Definition

Kvantisering omvandlar högprecisions flyttal (som FP32) till format med lägre precision (som INT8 eller FP16). Denna minskning reducerar modellens minnesanvändning och beräkningskrav, vilket möjliggör snabbare inferens.

Summary

En teknik för modelloptimering som minskar precisionen på tal som används i neuronnätsberäkningar för att minska storleken och öka hastigheten.

Key Concepts

  • Precisionsminskning
  • Inferenshastighet
  • Minnesoptimering
  • INT8/FP16

Use Cases

  • Distribution på enheter i kanterna (Edge devices)
  • Mobila AI-applikationer
  • Realtidsinferens

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)