Vllm
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) — это библиотека с открытым исходным кодом, разработанная для ускорения обслуживания LLM. Она внедряет PagedAttention, технику управления памятью, вдохновленную виртуальной памятью операционных систем, что позволяет эффективно управлять KV-кэшем.
Summary
vLLM — это высокопроизводительный и эффективный по памяти движок инференса для больших языковых моделей, использующий технологию PagedAttention для оптимизации использования памяти GPU.
Key Concepts
- PagedAttention
- Управление KV-кэшем
- Сервисный инференс
- Оптимизация пропускной способности
Use Cases
- Обслуживание API с высокой конкурентностью
- Пакетная обработка инференса
- Экономически эффективное развертывание LLM
Code Example
| |