Compresión de modelos

term_id: model_compression

Category: training_techniques

Definition

Esta categoría incluye métodos como la poda, la cuantización y la destilación de conocimientos, destinados a reducir la huella del modelo manteniendo el rendimiento. Es esencial para desplegar modelos de IA complejos

Summary

La compresión de modelos se refiere a técnicas que reducen el tamaño y los requisitos computacionales de los modelos de aprendizaje automático.

Key Concepts

  • Cuantización
  • Poda
  • Destilación de conocimientos
  • Velocidad de inferencia

Use Cases

  • Despliegue de modelos en dispositivos móviles
  • Reducción de costos de inferencia en la nube
  • Aceleración del procesamiento de vídeo en tiempo real

Code Example

1
2
import torch.quantization as quant
model = quant.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)