PagedAttention

term_id: pagedattention

Category: training_techniques

Definition

PagedAttention — это техника, представленная проектом vLLM, направленная на повышение эффективности вывода (инференса) больших языковых моделей. Она решает проблемы фрагментации памяти и накладных расходов при управлении KV-кэшем, позволяя динамически распределять память GPU аналогично тому, как операционные системы управляют виртуальной памятью.

Summary

PagedAttention — алгоритм управления памятью, адаптирующий концепции страничной виртуальной памяти для оптимизации хранения и доступа к ключевым и значениевым (KV) кэшам в моделях трансформеров.

Key Concepts

  • Управление KV-кэшем
  • Фрагментация памяти
  • Оптимизация инференса
  • Страничная виртуальная память

Use Cases

  • Сервисы с высокой пропускной способностью для больших языковых моделей
  • Снижение потребления памяти GPU
  • Оптимизация пакетной обработки в производственных средах