PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention je technika představená projektem vLLM pro zlepšení efektivity inferencí velkých jazykových modelů. Řeší problémy s fragmentací a překážkami při správě KV cache, což…

Summary

PagedAttention je algoritmus pro správu paměti, který přizpůsobuje koncepty virtuální paměti k optimalizaci ukládání a přístupu ke Key-Value (KV) cache v modelech typu Transformer.

Key Concepts

  • Správa KV cache
  • Fragmentace paměti
  • Optimalizace inferencí
  • Stránkování virtuální paměti

Use Cases

  • Obsluha LLM s vysokou propustností
  • Snížení využití paměti GPU
  • Optimalizace dávkového zpracování ve výrobě