Model Compression

term_id: model_compression

Category: training_techniques

Definition

Nhóm phương pháp này bao gồm các kỹ thuật như cắt tỉa (pruning), lượng tử hóa (quantization) và distillation tri thức (knowledge distillation), nhằm thu nhỏ footprint của mô hình trong khi vẫn duy trì hiệu suất. Đây là yếu tố thiết yếu để triển khai các mô hình AI phức tạp

Summary

Model Compression (nén mô hình) đề cập đến các kỹ thuật nhằm giảm kích thước và yêu cầu tính toán của các mô hình học máy.

Key Concepts

  • Lượng tử hóa
  • Cắt tỉa
  • Distillation tri thức
  • Tốc độ suy luận

Use Cases

  • Triển khai mô hình trên thiết bị di động
  • Giảm chi phí suy luận trên đám mây
  • Tăng tốc xử lý video thời gian thực

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)