كل المشاريع مفتوحة المصدر
مفتوح المصدراستدلال10k

Triton Inference Server

خادم NVIDIA للإنتاج لأي إطار وأي نموذج وأي أجهزة.

Triton Inference Server هو منصة خدمة الاستدلال مفتوحة المصدر من NVIDIA لنشر النماذج من أي إطار (TensorRT وPyTorch وTensorFlow وONNX وPython وغيرها) على وحدات معالجة الرسوميات أو المعالجات المركزية. يدعم تنفيذ نماذج متزامن ومعالجة دفعية ديناميكية ومجموعات نماذج ويكشف نقاط نهاية HTTP/gRPC مع مقاييس مدمجة. يُستخدم على نطاق واسع كطبقة خدمة إنتاجية لـ LLMs (عبر خلفية TensorRT-LLM) والذكاء الاصطناعي التقليدي على حد سواء.

المستودع

triton-inference-server/server

اللغة

Python

ما الذي يمكنك بناؤه به

  • إطلاق نقطة نهاية استدلال إنتاجية تخدم نماذج من أطر مختلطة خلف API واحد
  • استخدام المعالجة الدفعية الديناميكية وتنفيذ النماذج المتزامن لرفع استخدام وحدة معالجة الرسوميات
  • خدمة LLMs على نطاق واسع عبر خلفيات TensorRT-LLM أو vLLM مع المقاييس والتحجيم التلقائي

الوسوم

servingnvidiaproductionmulti-framework