Açık KaynakÇıkarım84k
vLLM
PagedAttention üzerine kurulu yüksek verimli LLM sunucu motoru.
vLLM, ilk olarak UC Berkeley'den çıkmış, yüksek verimli ve bellek açısından verimli bir LLM çıkarım ve sunum motorudur. Temel yeniliği olan PagedAttention, dikkat anahtar-değer önbelleğini sanal bellek gibi yöneterek GPU bellek kullanımını ve toplu işlem verimini büyük ölçüde artırır. Sürekli toplu işleme, tensör ve pipeline paralelliği, kuantizasyon ve OpenAI uyumlu bir sunucu destekler; üretim ölçekli sunum için yaygın biçimde kullanılır.
Depo
vllm-project/vllmDil
PythonBununla neler kurabilirsin
- Üretimde açık ağırlıklı modelleri yüksek verim ve düşük gecikmeyle sunma
- Sürekli toplu işlem aracılığıyla çok sayıda eş zamanlı çıkarım isteği için GPU kullanımını en üst düzeye çıkarma
- OpenAI uyumlu API'nin arkasında tensör ve pipeline paralelliğiyle büyük modelleri birden fazla GPU'da çalıştırma
Etiketler
servingthroughputgpu