All åpen kildekode
Åpen kildekodeInferens84k

vLLM

Høy-gjennomstrømnings LLM-servingmotor bygget rundt PagedAttention.

vLLM er en høy-gjennomstrømnings, minneeffektiv inferens- og servingmotor for LLM-er, opprinnelig fra UC Berkeley. Kjernebidraget, PagedAttention, administrerer attention-nøkkelverdi-bufferen som virtuelt minne for å øke GPU-minneutnyttelsen og batching-gjennomstrømningen betydelig. Den støtter kontinuerlig batching, tensor- og pipeline-parallellisme, kvantisering og en OpenAI-kompatibel server, og er mye brukt for produksjonsskala-serving.

Kodelager

vllm-project/vllm

Språk

Python

Det du kan bygge med den

  • Serve åpne modeller med høy gjennomstrømning og lav latens i produksjon
  • Maksimere GPU-utnyttelsen for mange samtidige inferensforespørsler via kontinuerlig batching
  • Kjøre store modeller på tvers av flere GPU-er med tensor- og pipeline-parallellisme bak et OpenAI-kompatibelt API

Tagger

servingthroughputgpu