Vllm
term_id: vllm
Category: application_paradigms
Definition
O vLLM (Virtual Large Language Model) é uma biblioteca de código aberto projetada para acelerar o serviço de LLMs. Ele introduz o PagedAttention, uma técnica de gerenciamento de memória inspirada na memória virtual de sistemas operacionais
Summary
O vLLM é um mecanismo de inferência de alta taxa de transferência e eficiente em memória para Grandes Modelos de Linguagem, utilizando PagedAttention para otimizar o uso de memória da GPU.
Key Concepts
- PagedAttention
- Gerenciamento de Cache KV
- Serviço de Inferência
- Otimização de Taxa de Transferência
Use Cases
- Serviço de APIs de alta concorrência
- Processamento de inferência em lotes
- Implantação de LLMs com baixo custo
Code Example
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)