vLLM

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) to biblioteka open-source zaprojektowana w celu przyspieszenia usługi (serving) LLM. Wprowadza ona PagedAttention, technikę zarządzania pamięcią inspirowaną wirtualną pamięcią systemów operacyjnych

Summary

vLLM to silnik wnioskowania o wysokiej przepustowości i efektywnym zużyciu pamięci dla dużych modeli językowych, wykorzystujący PagedAttention do optymalizacji użycia pamięci GPU.

Key Concepts

  • PagedAttention
  • Zarządzanie buforem KV
  • Usługiwnienie wnioskowania
  • Optymalizacja przepustowości

Use Cases

  • Obsługa API o wysokiej konkurencji
  • Przetwarzanie wsadowe wnioskowań
  • Kosztoefektywne wdrażanie LLM

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)