الانتباه المجزأ (PagedAttention)

term_id: pagedattention

Category: training_techniques

Definition

الانتباه المجزأ هي تقنية قدمها مشروع vLLM لتحسين كفاءة استنتاج نماذج اللغات الكبيرة. تعالج هذه التقنية مشكلات تجزئة الذاكرة والنفقات العامة المرتبطة بإدارة ذاكرة التخزين المؤقت للمفتاح والقيمة (KV Cache)، مما يسمح بتخزين أكثر كفاءة واستخدام أمثل لوحدة معالجة الرسومات (GPU) أثناء تشغيل النماذج.

Summary

الانتباه المجزأ هو خوارزمية لإدارة الذاكرة تتبنى مفاهيم التجزئة في الذاكرة الافتراضية لتحسين تخزين والوصول إلى ذاكرة التخزين المؤقت للمفتاح والقيمة (KV) في نماذج المحولات.

Key Concepts

  • إدارة ذاكرة التخزين المؤقت للمفتاح والقيمة
  • تجزئة الذاكرة
  • تحسين الاستنتاج
  • تجزئة الذاكرة الافتراضية

Use Cases

  • خدمة نماذج اللغات الكبيرة عالية الإنتاجية
  • تقليل استخدام ذاكرة وحدة معالجة الرسومات
  • تحسين معالجة الدفعات في البيئات الإنتاجية