vLLM
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) er et åpen kildekode-bibliotek designet for å akselerere levering av LLM-er. Det introduserer PagedAttention, en minnehåndteringsteknikk inspirert av operativsystemers virtuelle minne, som effektivt håndterer KV-cache og reduserer minneavfall.
Summary
vLLM er en inferenstmotor med høy gjennomstrømning og minneeffektivitet for store språkmodeller, som bruker PagedAttention for å optimalisere GPU-minnebruk.
Key Concepts
- PagedAttention
- KV-cache-håndtering
- Inferens-levering
- Gjennomstrømsoptimalisering
Use Cases
- Levering av API-er med høy konkurrens
- Batch-prosessering av inferens
- Kostnadseffektiv distribusjon av LLM
Code Example
| |