PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention היא טכניקה שהוכנסה על ידי פרויקט vLLM כדי לשפר את היעילות של הסקת מסקנות (Inference) במודלי שפה גדולים. היא פותרת את בעיות השבירה (Fragmentation) והעומס בניהול ה-KV Cache, המאפשרות ניצול יעיל יותר של זיכרון ה-GPU.

Summary

PagedAttention הוא אלגוריתם לניהול זיכרון המותאם ממושגי הדפוס של זיכרון וירטואלי כדי לייעל את אחסון וגישת ה-KV Cache (מטמון מפתח-ערך) במודלי טרנספורמר.

Key Concepts

  • ניהול KV Cache
  • שבירת זיכרון
  • אופטימיזציית הסקה
  • דפוס זיכרון וירטואלי

Use Cases

  • הפעלת LLM עם פלט גבוה (High-throughput serving)
  • הפחתת שימוש בזיכרון GPU
  • אופטימיזציה של עיבוד אצוות (Batch processing) בסביבת ייצור