Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) is een open-source bibliotheek die is ontworpen om het serveren van LLM’s te versnellen. Het introduceert PagedAttention, een techniek voor geheugenbeheer geïnspireerd door virtueel geheugen in besturingssystemen, wat leidt tot efficiënter gebruik van GPU-geheugen en hogere doorvoer.

Summary

vLLM is een inferentie-engine met hoge doorvoer en efficiënt geheugengebruik voor Large Language Models, die PagedAttention gebruikt om het GPU-geheugengebruik te optimaliseren.

Key Concepts

  • PagedAttention
  • KV-cachebeheer
  • Inferentieservering
  • Doorvoeroptimalisatie

Use Cases

  • Servering van API’s met hoge gelijktijdigheid
  • Batchgewijze verwerking van inferenties
  • Kostenefficiënte implementatie van LLM’s

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)