vLLM

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) es una biblioteca de código abierto diseñada para acelerar el servicio de LLM. Introduce PagedAttention, una técnica de gestión de memoria inspirada en la memoria virtual de los sistemas operativos, lo que permite un manejo más eficiente de la caché KV y mayor concurrencia.

Summary

vLLM es un motor de inferencia de alto rendimiento y eficiente en memoria para modelos de lenguaje grandes, que utiliza PagedAttention para optimizar el uso de la memoria de la GPU.

Key Concepts

  • PagedAttention
  • Gestión de caché KV
  • Servicio de inferencia
  • Optimización de rendimiento

Use Cases

  • Servicio de APIs de alta concurrencia
  • Procesamiento de inferencia por lotes
  • Despliegue de LLM rentable

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)