vLLM
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) to biblioteka open-source zaprojektowana w celu przyspieszenia usługi (serving) LLM. Wprowadza ona PagedAttention, technikę zarządzania pamięcią inspirowaną wirtualną pamięcią systemów operacyjnych
Summary
vLLM to silnik wnioskowania o wysokiej przepustowości i efektywnym zużyciu pamięci dla dużych modeli językowych, wykorzystujący PagedAttention do optymalizacji użycia pamięci GPU.
Key Concepts
- PagedAttention
- Zarządzanie buforem KV
- Usługiwnienie wnioskowania
- Optymalizacja przepustowości
Use Cases
- Obsługa API o wysokiej konkurencji
- Przetwarzanie wsadowe wnioskowań
- Kosztoefektywne wdrażanie LLM
Code Example
| |