Tensori compressi
term_id: compressed_tensors
Category: basic_concepts
Definition
I tensori compressi sono array multidimensionali utilizzati nel deep learning in cui la precisione numerica (ad esempio, da float32 a int8) o la sparsità è stata ridotta. Questa tecnica, nota come quantizzazione o compressione, mira a ridurre l’impronta di memoria e accelerare l’inferenza.
Summary
Tensori la cui precisione o dimensione dei dati è stata ridotta per ottimizzare lo stoccaggio e l’efficienza computazionale.
Key Concepts
- Quantizzazione
- Sparsità
- Ottimizzazione della memoria
- Velocità di inferenza
Use Cases
- Deployment di applicazioni IA su dispositivi mobili
- Elaborazione su dispositivi edge
- Ottimizzazione del servizio di modelli linguistici di grandi dimensioni
Code Example
| |