Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) ist eine Open-Source-Bibliothek, die darauf ausgelegt ist, das Serving von LLMs zu beschleunigen. Es führt PagedAttention ein, eine Speichermanagement-Technik, die von der virtuellen Speicherverwaltung von Be

Summary

vLLM ist eine hochdurchsatzorientierte und speichereffiziente Inferenz-Engine für Large Language Models, die PagedAttention nutzt, um die GPU-Speichernutzung zu optimieren.

Key Concepts

  • PagedAttention
  • KV-Cache-Management
  • Inferenz-Serving
  • Durchsatzoptimierung

Use Cases

  • Serving von APIs mit hoher Parallelität
  • Batch-Verarbeitung von Inferenzen
  • Kosteneffiziente Bereitstellung von LLMs

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)