Alle open source
Open SourceInferentie11k

TensorRT-LLM

NVIDIA's bibliotheek voor het optimaliseren en serveren van LLM's op zijn GPU's.

TensorRT-LLM is NVIDIA's open-source bibliotheek voor het compileren en uitvoeren van geoptimaliseerde LLM-inferentie op NVIDIA GPU's. Het biedt een Python API om sterk afgestemde TensorRT-engines te definiëren en te bouwen met functies zoals in-flight batching, paged KV-caching, FP8/INT4-kwantisatie en tensor/pipeline-parallelisme. Het werkt samen met de Triton Inference Server-backend om een van de laagste latenties voor LLM-serving op NVIDIA-hardware te leveren.

Opslagplaats

NVIDIA/TensorRT-LLM

Taal

C++

Wat je ermee zou bouwen

  • LLM's compileren tot geoptimaliseerde TensorRT-engines voor de laagste latentie op NVIDIA-datacenter-GPU's
  • Gekwantiseerde (FP8/INT4) modellen serveren met in-flight batching om GPU-doorvoer te maximaliseren
  • Multi-GPU LLM-inferentie implementeren met tensor- en pipeline-parallelisme achter Triton

Tags

servingnvidiagpuquantization