Komprimerte tensorer
term_id: compressed_tensors
Category: basic_concepts
Definition
Komprimerte tensorer er flerdimensjonale arrayer brukt i dyp læring der den numeriske presisjonen (f.eks. fra float32 til int8) eller sparsomheten er redusert. Denne teknikken, kjent som kvantisering eller
Summary
Tensorer hvor datapresisjonen eller størrelsen er redusert for å optimalisere lagring og beregningseffektivitet.
Key Concepts
- Kvantisering
- Sparsomhet
- Minneoptimalisering
- Inferenstakt
Use Cases
- Utplassering av mobile AI-applikasjoner
- Behandling på kantenheter (edge devices)
- Optimalisering av servering av store språkmodeller
Code Example
import torch
# Example of converting a tensor to half precision
x = torch.randn(10, 10)
x_compressed = x.half()