PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention je technika představená projektem vLLM pro zlepšení efektivity inferencí velkých jazykových modelů. Řeší problémy s fragmentací a překážkami při správě KV cache, což…
Summary
PagedAttention je algoritmus pro správu paměti, který přizpůsobuje koncepty virtuální paměti k optimalizaci ukládání a přístupu ke Key-Value (KV) cache v modelech typu Transformer.
Key Concepts
- Správa KV cache
- Fragmentace paměti
- Optimalizace inferencí
- Stránkování virtuální paměti
Use Cases
- Obsluha LLM s vysokou propustností
- Snížení využití paměti GPU
- Optimalizace dávkového zpracování ve výrobě