Open SourceInferenza84k
vLLM
Motore di serving LLM ad alto throughput basato su PagedAttention.
vLLM è un motore di inferenza e serving per LLM ad alto throughput e con memoria efficiente, originariamente sviluppato all'UC Berkeley. La sua innovazione principale, PagedAttention, gestisce la cache key-value dell'attention come memoria virtuale per migliorare sensibilmente l'utilizzo della memoria GPU e il throughput in batching. Supporta continuous batching, parallelismo tensoriale e a pipeline, quantizzazione e un server compatibile con OpenAI; è ampiamente utilizzato per il serving in produzione su larga scala.
Repository
vllm-project/vllmLinguaggio
PythonCosa ci costruiresti
- Servire modelli open-weight con alto throughput e bassa latenza in produzione
- Massimizzare l'utilizzo della GPU per molte richieste di inferenza concorrenti tramite continuous batching
- Eseguire modelli di grandi dimensioni su più GPU con parallelismo tensoriale e a pipeline dietro un'API compatibile con OpenAI
Tag
servingthroughputgpu