كل المشاريع مفتوحة المصدر
مفتوح المصدراستدلال11k

TensorRT-LLM

مكتبة NVIDIA لتحسين LLMs وخدمتها على وحدات معالجة الرسوميات الخاصة بها.

TensorRT-LLM هي مكتبة NVIDIA مفتوحة المصدر لتجميع وتشغيل استدلال LLM المُحسَّن على وحدات معالجة الرسوميات NVIDIA. توفر Python API لتعريف وبناء محركات TensorRT مُضبَطة بشدة مع ميزات كالمعالجة الدفعية أثناء الطيران وتخزين KV المُقسَّم إلى صفحات وكميّة FP8/INT4 والتوازي الموتري/التدفقي. تتزاوج مع خلفية Triton Inference Server لتقديم أدنى زمن استجابة لـ LLM على أجهزة NVIDIA.

المستودع

NVIDIA/TensorRT-LLM

اللغة

C++

ما الذي يمكنك بناؤه به

  • تجميع LLMs في محركات TensorRT مُحسَّنة لأدنى زمن استجابة على وحدات معالجة الرسوميات لمراكز بيانات NVIDIA
  • خدمة نماذج مُكمَّمة (FP8/INT4) مع معالجة دفعية أثناء الطيران لتعظيم إنتاجية وحدة معالجة الرسوميات
  • نشر استدلال LLM متعدد وحدات معالجة الرسوميات بتوازي موتري وتدفقي خلف Triton

الوسوم

servingnvidiagpuquantization