Åpen kildekodeInferens84k
vLLM
Høy-gjennomstrømnings LLM-servingmotor bygget rundt PagedAttention.
vLLM er en høy-gjennomstrømnings, minneeffektiv inferens- og servingmotor for LLM-er, opprinnelig fra UC Berkeley. Kjernebidraget, PagedAttention, administrerer attention-nøkkelverdi-bufferen som virtuelt minne for å øke GPU-minneutnyttelsen og batching-gjennomstrømningen betydelig. Den støtter kontinuerlig batching, tensor- og pipeline-parallellisme, kvantisering og en OpenAI-kompatibel server, og er mye brukt for produksjonsskala-serving.
Kodelager
vllm-project/vllmSpråk
PythonDet du kan bygge med den
- Serve åpne modeller med høy gjennomstrømning og lav latens i produksjon
- Maksimere GPU-utnyttelsen for mange samtidige inferensforespørsler via kontinuerlig batching
- Kjøre store modeller på tvers av flere GPU-er med tensor- og pipeline-parallellisme bak et OpenAI-kompatibelt API
Tagger
servingthroughputgpu