Åpen kildekodeInferens84k
vLLM
محرك تقديم LLM عالي الإنتاجية مبني حول PagedAttention.
vLLM محرك استدلال وتقديم عالي الإنتاجية وفعّال في استخدام الذاكرة لنماذج LLM، صادر أصلًا من UC Berkeley. ابتكاره الأساسي، PagedAttention، يدير ذاكرة التخزين المؤقت لقيم ومفاتيح الانتباه كالذاكرة الافتراضية لتحسين استخدام ذاكرة GPU والإنتاجية الدُفعية بشكل كبير. يدعم الدفع المستمر والتوازي الموتري وتوازي الخط الأنبوبي والتكميم وخادمًا متوافقًا مع OpenAI، ويُستخدم على نطاق واسع في التقديم على مستوى الإنتاج.
Kodelager
vllm-project/vllmSpråk
PythonDet du kan bygge med den
- تقديم النماذج ذات الأوزان المفتوحة بإنتاجية عالية وكمون منخفض في الإنتاج
- تعظيم استخدام GPU لطلبات الاستدلال المتزامنة الكثيرة عبر الدفع المستمر
- تشغيل نماذج كبيرة عبر عدة وحدات GPU بالتوازي الموتري وتوازي الخط الأنبوبي خلف API متوافقة مع OpenAI
Tagger
servingthroughputgpu