PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention è una tecnica introdotta dal progetto vLLM per migliorare l’efficienza dell’inferenza dei grandi modelli linguistici. Affronta i problemi di frammentazione e overhead nella gestione della cache KV, consentendo un utilizzo della memoria GPU molto più efficiente rispetto ai metodi tradizionali, supportando così batch di richiesta più grandi e una latenza ridotta.

Summary

PagedAttention è un algoritmo di gestione della memoria che adatta i concetti di paging della memoria virtuale per ottimizzare lo storage e l’accesso alle cache Key-Value (KV) nei modelli transformer.

Key Concepts

  • Gestione della Cache KV
  • Frammentazione della Memoria
  • Ottimizzazione dell’Inferenza
  • Paging della Memoria Virtuale

Use Cases

  • Servizio di LLM ad alta throughput
  • Riduzione dell’utilizzo della memoria GPU
  • Ottimizzazione dell’elaborazione batch in produzione