PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention è una tecnica introdotta dal progetto vLLM per migliorare l’efficienza dell’inferenza dei grandi modelli linguistici. Affronta i problemi di frammentazione e overhead nella gestione della cache KV, consentendo un utilizzo della memoria GPU molto più efficiente rispetto ai metodi tradizionali, supportando così batch di richiesta più grandi e una latenza ridotta.
Summary
PagedAttention è un algoritmo di gestione della memoria che adatta i concetti di paging della memoria virtuale per ottimizzare lo storage e l’accesso alle cache Key-Value (KV) nei modelli transformer.
Key Concepts
- Gestione della Cache KV
- Frammentazione della Memoria
- Ottimizzazione dell’Inferenza
- Paging della Memoria Virtuale
Use Cases
- Servizio di LLM ad alta throughput
- Riduzione dell’utilizzo della memoria GPU
- Ottimizzazione dell’elaborazione batch in produzione