PagedAttention
term_id: pagedattention
Category: training_techniques
Definition
PagedAttention — это техника, представленная проектом vLLM, направленная на повышение эффективности вывода (инференса) больших языковых моделей. Она решает проблемы фрагментации памяти и накладных расходов при управлении KV-кэшем, позволяя динамически распределять память GPU аналогично тому, как операционные системы управляют виртуальной памятью.
Summary
PagedAttention — алгоритм управления памятью, адаптирующий концепции страничной виртуальной памяти для оптимизации хранения и доступа к ключевым и значениевым (KV) кэшам в моделях трансформеров.
Key Concepts
- Управление KV-кэшем
- Фрагментация памяти
- Оптимизация инференса
- Страничная виртуальная память
Use Cases
- Сервисы с высокой пропускной способностью для больших языковых моделей
- Снижение потребления памяти GPU
- Оптимизация пакетной обработки в производственных средах