Open SourceInferentie84k
vLLM
High-throughput LLM-servingengine gebouwd rond PagedAttention.
vLLM is een high-throughput, geheugenefficiënte inferentie- en servingengine voor LLMs, oorspronkelijk ontwikkeld aan UC Berkeley. De kernvernieuwing, PagedAttention, beheert de aandacht key-value cache als virtueel geheugen om GPU-geheugenbenutting en batching-throughput sterk te verbeteren. Het ondersteunt continue batching, tensor- en pipelineparallelisme, kwantisatie en een OpenAI-compatibele server, en wordt breed ingezet voor serving op productieschaal.
Opslagplaats
vllm-project/vllmTaal
PythonWat je ermee zou bouwen
- Open-weight modellen serveren met hoge throughput en lage latentie in productie
- GPU-benutting maximaliseren voor veel gelijktijdige inferentieverzoeken via continue batching
- Grote modellen over meerdere GPU's uitvoeren met tensor- en pipelineparallelisme achter een OpenAI-compatibele API
Tags
servingthroughputgpu