مفتوح المصدراستدلال10k
Triton Inference Server
خادم NVIDIA للإنتاج لأي إطار وأي نموذج وأي أجهزة.
Triton Inference Server هو منصة خدمة الاستدلال مفتوحة المصدر من NVIDIA لنشر النماذج من أي إطار (TensorRT وPyTorch وTensorFlow وONNX وPython وغيرها) على وحدات معالجة الرسوميات أو المعالجات المركزية. يدعم تنفيذ نماذج متزامن ومعالجة دفعية ديناميكية ومجموعات نماذج ويكشف نقاط نهاية HTTP/gRPC مع مقاييس مدمجة. يُستخدم على نطاق واسع كطبقة خدمة إنتاجية لـ LLMs (عبر خلفية TensorRT-LLM) والذكاء الاصطناعي التقليدي على حد سواء.
المستودع
triton-inference-server/serverاللغة
Pythonما الذي يمكنك بناؤه به
- إطلاق نقطة نهاية استدلال إنتاجية تخدم نماذج من أطر مختلطة خلف API واحد
- استخدام المعالجة الدفعية الديناميكية وتنفيذ النماذج المتزامن لرفع استخدام وحدة معالجة الرسوميات
- خدمة LLMs على نطاق واسع عبر خلفيات TensorRT-LLM أو vLLM مع المقاييس والتحجيم التلقائي
الوسوم
servingnvidiaproductionmulti-framework