Öppen källkodInferens84k
vLLM
Högdataflödes-LLM-serveringsmotor byggd kring PagedAttention.
vLLM är en inferens- och serveringsmotor för LLM:er med högt dataflöde och minneseffektivitet, ursprungligen från UC Berkeley. Dess kärnteknologi, PagedAttention, hanterar attention-nyckel-värdescachen som virtuellt minne för att kraftigt förbättra GPU-minnesutnyttjande och batchningsgenomströmning. Det stöder kontinuerlig batchning, tensor- och pipeline-parallellism, kvantisering och en OpenAI-kompatibel server, och används i stor utsträckning för produktionsskalad servering.
Kodförråd
vllm-project/vllmSpråk
PythonVad du kan bygga med det
- Serva öppenviktsmodeller med högt dataflöde och låg latens i produktion
- Maximera GPU-utnyttjandet för många parallella inferensförfrågningar via kontinuerlig batchning
- Köra stora modeller över flera GPU:er med tensor- och pipeline-parallellism bakom ett OpenAI-kompatibelt API
Taggar
servingthroughputgpu