الانتباه المجزأ (PagedAttention)
term_id: pagedattention
Category: training_techniques
Definition
الانتباه المجزأ هي تقنية قدمها مشروع vLLM لتحسين كفاءة استنتاج نماذج اللغات الكبيرة. تعالج هذه التقنية مشكلات تجزئة الذاكرة والنفقات العامة المرتبطة بإدارة ذاكرة التخزين المؤقت للمفتاح والقيمة (KV Cache)، مما يسمح بتخزين أكثر كفاءة واستخدام أمثل لوحدة معالجة الرسومات (GPU) أثناء تشغيل النماذج.
Summary
الانتباه المجزأ هو خوارزمية لإدارة الذاكرة تتبنى مفاهيم التجزئة في الذاكرة الافتراضية لتحسين تخزين والوصول إلى ذاكرة التخزين المؤقت للمفتاح والقيمة (KV) في نماذج المحولات.
Key Concepts
- إدارة ذاكرة التخزين المؤقت للمفتاح والقيمة
- تجزئة الذاكرة
- تحسين الاستنتاج
- تجزئة الذاكرة الافتراضية
Use Cases
- خدمة نماذج اللغات الكبيرة عالية الإنتاجية
- تقليل استخدام ذاكرة وحدة معالجة الرسومات
- تحسين معالجة الدفعات في البيئات الإنتاجية