Tüm açık kaynaklar
Açık KaynakÇıkarım84k

vLLM

PagedAttention üzerine kurulu yüksek verimli LLM sunucu motoru.

vLLM, ilk olarak UC Berkeley'den çıkmış, yüksek verimli ve bellek açısından verimli bir LLM çıkarım ve sunum motorudur. Temel yeniliği olan PagedAttention, dikkat anahtar-değer önbelleğini sanal bellek gibi yöneterek GPU bellek kullanımını ve toplu işlem verimini büyük ölçüde artırır. Sürekli toplu işleme, tensör ve pipeline paralelliği, kuantizasyon ve OpenAI uyumlu bir sunucu destekler; üretim ölçekli sunum için yaygın biçimde kullanılır.

Depo

vllm-project/vllm

Dil

Python

Bununla neler kurabilirsin

  • Üretimde açık ağırlıklı modelleri yüksek verim ve düşük gecikmeyle sunma
  • Sürekli toplu işlem aracılığıyla çok sayıda eş zamanlı çıkarım isteği için GPU kullanımını en üst düzeye çıkarma
  • OpenAI uyumlu API'nin arkasında tensör ve pipeline paralelliğiyle büyük modelleri birden fazla GPU'da çalıştırma

Etiketler

servingthroughputgpu