Alle Open Source
Open SourceInferenz84k

vLLM

Hochdurchsatz-LLM-Serving-Engine auf Basis von PagedAttention.

vLLM ist eine hochdurchsatz- und speichereffiziente Inferenz- und Serving-Engine für LLMs, ursprünglich von der UC Berkeley. Die Kerninnovation, PagedAttention, verwaltet den Attention-Key-Value-Cache wie virtuellen Speicher und verbessert so die GPU-Speicherauslastung und den Batching-Durchsatz erheblich. Es unterstützt Continuous Batching, Tensor- und Pipeline-Parallelismus, Quantisierung sowie einen OpenAI-kompatiblen Server und wird weit verbreitet für den produktionsreifen Betrieb eingesetzt.

Repository

vllm-project/vllm

Sprache

Python

Was du damit bauen kannst

  • Bereitstellen von Open-Weight-Modellen mit hohem Durchsatz und niedriger Latenz im Produktionsbetrieb
  • Maximieren der GPU-Auslastung für viele gleichzeitige Inferenzanfragen via Continuous Batching
  • Ausführen großer Modelle über mehrere GPUs mit Tensor- und Pipeline-Parallelismus hinter einer OpenAI-kompatiblen API

Tags

servingthroughputgpu