Vllm

term_id: vllm

Category: application_paradigms

Definition

O vLLM (Virtual Large Language Model) é uma biblioteca de código aberto projetada para acelerar o serviço de LLMs. Ele introduz o PagedAttention, uma técnica de gerenciamento de memória inspirada na memória virtual de sistemas operacionais

Summary

O vLLM é um mecanismo de inferência de alta taxa de transferência e eficiente em memória para Grandes Modelos de Linguagem, utilizando PagedAttention para otimizar o uso de memória da GPU.

Key Concepts

  • PagedAttention
  • Gerenciamento de Cache KV
  • Serviço de Inferência
  • Otimização de Taxa de Transferência

Use Cases

  • Serviço de APIs de alta concorrência
  • Processamento de inferência em lotes
  • Implantação de LLMs com baixo custo

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)