Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM (Virtual Large Language Model) adalah pustaka sumber terbuka yang dirancang untuk mempercepat penyajian LLM. Alat ini memperkenalkan PagedAttention, sebuah teknik manajemen memori yang terinspirasi oleh memori virtual sistem operasi

Summary

vLLM adalah mesin inferensi ber throughput tinggi dan hemat memori untuk Model Bahasa Besar, yang memanfaatkan PagedAttention untuk mengoptimalkan penggunaan memori GPU.

Key Concepts

  • PagedAttention
  • Manajemen KV Cache
  • Penyajian Inferensi
  • Optimasi Throughput

Use Cases

  • Penyajian API dengan konkurensi tinggi
  • Pemrosesan inferensi batch
  • Penyebaran LLM yang hemat biaya

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)