Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) — это библиотека с открытым исходным кодом, разработанная для ускорения обслуживания LLM. Она внедряет PagedAttention, технику управления памятью, вдохновленную виртуальной памятью операционных систем, что позволяет эффективно управлять KV-кэшем.

Summary

vLLM — это высокопроизводительный и эффективный по памяти движок инференса для больших языковых моделей, использующий технологию PagedAttention для оптимизации использования памяти GPU.

Key Concepts

  • PagedAttention
  • Управление KV-кэшем
  • Сервисный инференс
  • Оптимизация пропускной способности

Use Cases

  • Обслуживание API с высокой конкурентностью
  • Пакетная обработка инференса
  • Экономически эффективное развертывание LLM

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)