vLLM
term_id: vllm
Category: application_paradigms
Definition
vLLM (Virtual Large Language Model) est une bibliothèque open source conçue pour accélérer le déploiement des LLM. Elle introduit PagedAttention, une technique de gestion de la mémoire inspirée de la mémoire virtuelle des systèmes d’exploitation, permettant une allocation de mémoire KV cache plus efficace.
Summary
vLLM est un moteur d’inférence à haut débit et économe en mémoire pour les grands modèles de langage, utilisant la technique PagedAttention pour optimiser l’utilisation de la mémoire GPU.
Key Concepts
- PagedAttention
- Gestion du cache KV
- Serveur d’inférence
- Optimisation du débit
Use Cases
- Serveur d’API à haute concurrence
- Traitement par lots de l’inférence
- Déploiement rentable de LLM
Code Example
| |