vLLM

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) er et åpen kildekode-bibliotek designet for å akselerere levering av LLM-er. Det introduserer PagedAttention, en minnehåndteringsteknikk inspirert av operativsystemers virtuelle minne, som effektivt håndterer KV-cache og reduserer minneavfall.

Summary

vLLM er en inferenstmotor med høy gjennomstrømning og minneeffektivitet for store språkmodeller, som bruker PagedAttention for å optimalisere GPU-minnebruk.

Key Concepts

  • PagedAttention
  • KV-cache-håndtering
  • Inferens-levering
  • Gjennomstrømsoptimalisering

Use Cases

  • Levering av API-er med høy konkurrens
  • Batch-prosessering av inferens
  • Kostnadseffektiv distribusjon av LLM

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)