모델 압축

term_id: model_compression

Category: training_techniques

Definition

이 범주에는 모델의 용량을 줄이면서도 성능을 유지하는 것을 목표로 하는 가지치기(Pruning), 양자화(Quantization), 지식 증류(Knowledge Distillation) 등의 방법이 포함됩니다. 이는 복잡한 AI 모델을 배포하는 데 필수적입니다.

Summary

모델 압축은 머신러닝 모델의 크기와 계산 요구 사항을 줄이는 기법을 의미합니다.

Key Concepts

  • 양자화
  • 가지치기
  • 지식 증류
  • 추론 속도

Use Cases

  • 모바일 기기에서 모델 배포
  • 클라우드 추론 비용 절감
  • 실시간 비디오 처리 가속화

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)