PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention este o tehnică introdusă de proiectul vLLM pentru a îmbunătăți eficiența inferenței modelelor lingvistice mari. Abordează problemele de fragmentare și suprasarcină în gestionarea cache-ului KV, permițând o utilizare mai eficientă a memoriei GPU.

Summary

PagedAttention este un algoritm de gestionare a memoriei care adaptează conceptele de paginare a memoriei virtuale pentru a optimiza stocarea și accesul la cache-urile Cheie-Valori (KV) în modelele transformer.

Key Concepts

  • Gestionarea Cache-ului KV
  • Fragmentarea Memoriei
  • Optimizarea Inferenței
  • Paginarea Memoriei Virtuale

Use Cases

  • Servirea LLM cu randament ridicat
  • Reducerea utilizării memoriei GPU
  • Optimizarea procesării în loturi în producție