PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention היא טכניקה שהוכנסה על ידי פרויקט vLLM כדי לשפר את היעילות של הסקת מסקנות (Inference) במודלי שפה גדולים. היא פותרת את בעיות השבירה (Fragmentation) והעומס בניהול ה-KV Cache, המאפשרות ניצול יעיל יותר של זיכרון ה-GPU.
Summary
PagedAttention הוא אלגוריתם לניהול זיכרון המותאם ממושגי הדפוס של זיכרון וירטואלי כדי לייעל את אחסון וגישת ה-KV Cache (מטמון מפתח-ערך) במודלי טרנספורמר.
Key Concepts
- ניהול KV Cache
- שבירת זיכרון
- אופטימיזציית הסקה
- דפוס זיכרון וירטואלי
Use Cases
- הפעלת LLM עם פלט גבוה (High-throughput serving)
- הפחתת שימוש בזיכרון GPU
- אופטימיזציה של עיבוד אצוות (Batch processing) בסביבת ייצור