vLLM
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) to biblioteka open-source zaprojektowana w celu przyspieszenia usługi (serving) LLM. Wprowadza ona PagedAttention, technikę zarządzania pamięcią inspirowaną wirtualną pamięcią systemów operacyjnych
Summary
vLLM to silnik wnioskowania o wysokiej przepustowości i efektywnym zużyciu pamięci dla dużych modeli językowych, wykorzystujący PagedAttention do optymalizacji użycia pamięci GPU.
Key Concepts
- PagedAttention
- Zarządzanie buforem KV
- Usługiwnienie wnioskowania
- Optymalizacja przepustowości
Use Cases
- Obsługa API o wysokiej konkurencji
- Przetwarzanie wsadowe wnioskowań
- Kosztoefektywne wdrażanie LLM
Code Example
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)