Tutto l'open source
Open SourceInferenza84k

vLLM

Motore di serving LLM ad alto throughput basato su PagedAttention.

vLLM è un motore di inferenza e serving per LLM ad alto throughput e con memoria efficiente, originariamente sviluppato all'UC Berkeley. La sua innovazione principale, PagedAttention, gestisce la cache key-value dell'attention come memoria virtuale per migliorare sensibilmente l'utilizzo della memoria GPU e il throughput in batching. Supporta continuous batching, parallelismo tensoriale e a pipeline, quantizzazione e un server compatibile con OpenAI; è ampiamente utilizzato per il serving in produzione su larga scala.

Repository

vllm-project/vllm

Linguaggio

Python

Cosa ci costruiresti

  • Servire modelli open-weight con alto throughput e bassa latenza in produzione
  • Massimizzare l'utilizzo della GPU per molte richieste di inferenza concorrenti tramite continuous batching
  • Eseguire modelli di grandi dimensioni su più GPU con parallelismo tensoriale e a pipeline dietro un'API compatibile con OpenAI

Tag

servingthroughputgpu