All öppen källkod
Öppen källkodInferens84k

vLLM

Högdataflödes-LLM-serveringsmotor byggd kring PagedAttention.

vLLM är en inferens- och serveringsmotor för LLM:er med högt dataflöde och minneseffektivitet, ursprungligen från UC Berkeley. Dess kärnteknologi, PagedAttention, hanterar attention-nyckel-värdescachen som virtuellt minne för att kraftigt förbättra GPU-minnesutnyttjande och batchningsgenomströmning. Det stöder kontinuerlig batchning, tensor- och pipeline-parallellism, kvantisering och en OpenAI-kompatibel server, och används i stor utsträckning för produktionsskalad servering.

Kodförråd

vllm-project/vllm

Språk

Python

Vad du kan bygga med det

  • Serva öppenviktsmodeller med högt dataflöde och låg latens i produktion
  • Maximera GPU-utnyttjandet för många parallella inferensförfrågningar via kontinuerlig batchning
  • Köra stora modeller över flera GPU:er med tensor- och pipeline-parallellism bakom ett OpenAI-kompatibelt API

Taggar

servingthroughputgpu