PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
A PagedAttention a vLLM projekt által bevezetett technika, amely javítja a nagy nyelvi modellek (LLM) inferenciájának hatékonyságát. Kezeli a KV gyorsítótár kezeléséből adódó memóriaszóródást (fragmentation) és túlterhelést, lehetővé téve a hatékonyabb memóriahasználatot.
Summary
A PagedAttention egy memóriakezelő algoritmus, amely a virtuális memória lapozási koncepcióit alkalmazza a transzformátor modellek kulcs-érték (KV) gyorsítótárának tárolásának és hozzáférésének optimalizálására.
Key Concepts
- KV gyorsítótár kezelése
- Memóriaszóródás
- Inferencia optimalizálás
- Virtuális memória lapozás
Use Cases
- Nagy áteresztőképességű LLM kiszolgálás
- GPU memória igény csökkentése
- Kötegelt feldolgozás optimalizálása termelési környezetben