Vllm

term_id: vllm

Category: application_paradigms

Definition

vLLM(Virtual Large Language Model)は、LLMサービングを加速するために設計されたオープンソースライブラリです。オペレーティングシステムの仮想メモリ…

Summary

vLLMは、PagedAttentionを活用してGPUメモリ使用量を最適化する、大規模言語モデル向けの高速スループットかつメモリ効率的な推論エンジンです。

Key Concepts

  • PagedAttention
  • KVキャッシュ管理
  • 推論サービング
  • スループット最適化

Use Cases

  • 高同時実行APIサービング
  • バッチ処理された推論処理
  • 費用対効果の高いLLMデプロイメント

Code Example

1
2
3
4
5
from vllm import LLM, SamplingParams
llm = LLM(model="facebook/opt-125m")
prompts = ["Hello, my name is", "The capital of France is"]
sampling_params = SamplingParams(temperature=0.8, top_p=0.95)
outputs = llm.generate(prompts, sampling_params)