Lượng tử hóa

term_id: quantization

Category: training_techniques

Definition

Lượng tử hóa chuyển đổi các số dấu phẩy động độ chính xác cao (như FP32) sang các định dạng độ chính xác thấp hơn (như INT8 hoặc FP16). Sự giảm bớt này làm giảm mức sử dụng bộ nhớ và yêu cầu tính toán của mô hình.

Summary

Một kỹ thuật tối ưu hóa mô hình làm giảm độ chính xác của các số được sử dụng trong tính toán mạng nơ-ron để giảm kích thước và cải thiện tốc độ.

Key Concepts

  • Giảm độ chính xác
  • Tốc độ suy luận
  • Tối ưu hóa bộ nhớ
  • INT8/FP16

Use Cases

  • Triển khai trên thiết bị biên
  • Ứng dụng AI di động
  • Suy luận thời gian thực

Code Example

1
2
3
4
5
6
import torch.quantization as quant
# Example of converting a model to quantized format
model.eval()
model.qconfig = quant.get_default_qconfig('fbgemm')
quantized_model = quant.prepare(model, inplace=False)
quantized_model = quant.convert(quantized_model, inplace=False)