مفتوح المصدراستدلال84k
vLLM
محرك تقديم LLM عالي الإنتاجية مبني حول PagedAttention.
vLLM محرك استدلال وتقديم عالي الإنتاجية وفعّال في استخدام الذاكرة لنماذج LLM، صادر أصلًا من UC Berkeley. ابتكاره الأساسي، PagedAttention، يدير ذاكرة التخزين المؤقت لقيم ومفاتيح الانتباه كالذاكرة الافتراضية لتحسين استخدام ذاكرة GPU والإنتاجية الدُفعية بشكل كبير. يدعم الدفع المستمر والتوازي الموتري وتوازي الخط الأنبوبي والتكميم وخادمًا متوافقًا مع OpenAI، ويُستخدم على نطاق واسع في التقديم على مستوى الإنتاج.
المستودع
vllm-project/vllmاللغة
Pythonما الذي يمكنك بناؤه به
- تقديم النماذج ذات الأوزان المفتوحة بإنتاجية عالية وكمون منخفض في الإنتاج
- تعظيم استخدام GPU لطلبات الاستدلال المتزامنة الكثيرة عبر الدفع المستمر
- تشغيل نماذج كبيرة عبر عدة وحدات GPU بالتوازي الموتري وتوازي الخط الأنبوبي خلف API متوافقة مع OpenAI
الوسوم
servingthroughputgpu