Vllm
term_id: vllm
Category: application_paradigms
Definition
O vLLM (Virtual Large Language Model) é uma biblioteca de código aberto projetada para acelerar o serviço de LLMs. Ele introduz o PagedAttention, uma técnica de gerenciamento de memória inspirada na memória virtual de sistemas operacionais
Summary
O vLLM é um mecanismo de inferência de alta taxa de transferência e eficiente em memória para Grandes Modelos de Linguagem, utilizando PagedAttention para otimizar o uso de memória da GPU.
Key Concepts
- PagedAttention
- Gerenciamento de Cache KV
- Serviço de Inferência
- Otimização de Taxa de Transferência
Use Cases
- Serviço de APIs de alta concorrência
- Processamento de inferência em lotes
- Implantação de LLMs com baixo custo
Code Example
| |