Tüm açık kaynaklar
Açık KaynakÇıkarım11k

TensorRT-LLM

NVIDIA'nın GPU'larında LLM'leri optimize etmek ve sunmak için kullanılan kütüphane.

TensorRT-LLM, NVIDIA GPU'larında optimize edilmiş LLM çıkarımını derlemek ve çalıştırmak için NVIDIA'nın açık kaynaklı kütüphanesidir. Uçuş sırasında toplu işleme, sayfalandırılmış KV önbelleği, FP8/INT4 nicemleme ve tensör/pipeline paralelizmi gibi özelliklerle yüksek düzeyde ayarlanmış TensorRT motorları tanımlamak ve oluşturmak için bir Python API'si sunar. NVIDIA donanımında en düşük gecikmeli LLM sunumu için Triton Inference Server arka ucuyla birlikte kullanılır.

Depo

NVIDIA/TensorRT-LLM

Dil

C++

Bununla neler kurabilirsin

  • NVIDIA veri merkezi GPU'larında en düşük gecikme için LLM'leri optimize edilmiş TensorRT motorlarına derleyin
  • GPU verimini en üst düzeye çıkarmak için uçuş sırasında toplu işlemeyle nicemleme yapılmış (FP8/INT4) modeller sunun
  • Triton arkasında tensör ve pipeline paralelizmiyle çok GPU'lu LLM çıkarımı dağıtın

Etiketler

servingnvidiagpuquantization