Alle open source
Open SourceInferentie84k

vLLM

High-throughput LLM-servingengine gebouwd rond PagedAttention.

vLLM is een high-throughput, geheugenefficiënte inferentie- en servingengine voor LLMs, oorspronkelijk ontwikkeld aan UC Berkeley. De kernvernieuwing, PagedAttention, beheert de aandacht key-value cache als virtueel geheugen om GPU-geheugenbenutting en batching-throughput sterk te verbeteren. Het ondersteunt continue batching, tensor- en pipelineparallelisme, kwantisatie en een OpenAI-compatibele server, en wordt breed ingezet voor serving op productieschaal.

Opslagplaats

vllm-project/vllm

Taal

Python

Wat je ermee zou bouwen

  • Open-weight modellen serveren met hoge throughput en lage latentie in productie
  • GPU-benutting maximaliseren voor veel gelijktijdige inferentieverzoeken via continue batching
  • Grote modellen over meerdere GPU's uitvoeren met tensor- en pipelineparallelisme achter een OpenAI-compatibele API

Tags

servingthroughputgpu