Open SourceInferenz84k
vLLM
Hochdurchsatz-LLM-Serving-Engine auf Basis von PagedAttention.
vLLM ist eine hochdurchsatz- und speichereffiziente Inferenz- und Serving-Engine für LLMs, ursprünglich von der UC Berkeley. Die Kerninnovation, PagedAttention, verwaltet den Attention-Key-Value-Cache wie virtuellen Speicher und verbessert so die GPU-Speicherauslastung und den Batching-Durchsatz erheblich. Es unterstützt Continuous Batching, Tensor- und Pipeline-Parallelismus, Quantisierung sowie einen OpenAI-kompatiblen Server und wird weit verbreitet für den produktionsreifen Betrieb eingesetzt.
Repository
vllm-project/vllmSprache
PythonWas du damit bauen kannst
- Bereitstellen von Open-Weight-Modellen mit hohem Durchsatz und niedriger Latenz im Produktionsbetrieb
- Maximieren der GPU-Auslastung für viele gleichzeitige Inferenzanfragen via Continuous Batching
- Ausführen großer Modelle über mehrere GPUs mit Tensor- und Pipeline-Parallelismus hinter einer OpenAI-kompatiblen API
Tags
servingthroughputgpu