vLLM

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model), LLM sunumunu hızlandırmak için tasarlanmış açık kaynaklı bir kütüphanedir. İşletim sistemlerinin sanal bellek yönetiminden ilham alan PagedAttention adlı bir bellek yönetimi tekniği tanıtır.

Summary

vLLM, PagedAttention kullanarak GPU bellek kullanımını optimize eden Büyük Dil Modelleri için yüksek verimli ve bellek verimli bir çıkarım motorudur.

Key Concepts

  • PagedAttention
  • KV Önbellek Yönetimi
  • Çıkarım Sunumu
  • Verimlilik Optimizasyonu

Use Cases

  • Yüksek eşzamanlılıkta API sunumu
  • Toplu çıkarım işleme
  • Maliyet etkin LLM dağıtımı

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)