vLLM

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) est une bibliothèque open source conçue pour accélérer le déploiement des LLM. Elle introduit PagedAttention, une technique de gestion de la mémoire inspirée de la mémoire virtuelle des systèmes d’exploitation, permettant une allocation de mémoire KV cache plus efficace.

Summary

vLLM est un moteur d’inférence à haut débit et économe en mémoire pour les grands modèles de langage, utilisant la technique PagedAttention pour optimiser l’utilisation de la mémoire GPU.

Key Concepts

  • PagedAttention
  • Gestion du cache KV
  • Serveur d’inférence
  • Optimisation du débit

Use Cases

  • Serveur d’API à haute concurrence
  • Traitement par lots de l’inférence
  • Déploiement rentable de LLM

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)