Komprimerte tensorer

term_id: compressed_tensors

Category: basic_concepts

Definition

Komprimerte tensorer er flerdimensjonale arrayer brukt i dyp læring der den numeriske presisjonen (f.eks. fra float32 til int8) eller sparsomheten er redusert. Denne teknikken, kjent som kvantisering eller

Summary

Tensorer hvor datapresisjonen eller størrelsen er redusert for å optimalisere lagring og beregningseffektivitet.

Key Concepts

  • Kvantisering
  • Sparsomhet
  • Minneoptimalisering
  • Inferenstakt

Use Cases

  • Utplassering av mobile AI-applikasjoner
  • Behandling på kantenheter (edge devices)
  • Optimalisering av servering av store språkmodeller

Code Example

1
2
3
4
import torch
# Example of converting a tensor to half precision
x = torch.randn(10, 10)
x_compressed = x.half()