Kompresja modeli

term_id: model_compression

Category: training_techniques

Definition

Do tej kategorii należą metody takie jak przycinanie (pruning), kwantyzacja i distylacja wiedzy, mające na celu zmniejszenie śladu modelu przy jednoczesnym zachowaniu wydajności. Jest to kluczowe dla wdrażania złożonych modeli AI

Summary

Kompresja modeli odnosi się do technik redukujących rozmiar oraz wymagania obliczeniowe modeli uczenia maszynowego.

Key Concepts

  • Kwantyzacja
  • Przycinanie (Pruning)
  • Distylacja wiedzy
  • Prędkość wnioskowania (Inference Speed)

Use Cases

  • Wdrażanie modeli na urządzeniach mobilnych
  • Redukcja kosztów wnioskowania w chmurze
  • Przyspieszanie przetwarzania wideo w czasie rzeczywistym

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)