Open SourceInferentie11k
TensorRT-LLM
NVIDIA's bibliotheek voor het optimaliseren en serveren van LLM's op zijn GPU's.
TensorRT-LLM is NVIDIA's open-source bibliotheek voor het compileren en uitvoeren van geoptimaliseerde LLM-inferentie op NVIDIA GPU's. Het biedt een Python API om sterk afgestemde TensorRT-engines te definiëren en te bouwen met functies zoals in-flight batching, paged KV-caching, FP8/INT4-kwantisatie en tensor/pipeline-parallelisme. Het werkt samen met de Triton Inference Server-backend om een van de laagste latenties voor LLM-serving op NVIDIA-hardware te leveren.
Opslagplaats
NVIDIA/TensorRT-LLMTaal
C++Wat je ermee zou bouwen
- LLM's compileren tot geoptimaliseerde TensorRT-engines voor de laagste latentie op NVIDIA-datacenter-GPU's
- Gekwantiseerde (FP8/INT4) modellen serveren met in-flight batching om GPU-doorvoer te maximaliseren
- Multi-GPU LLM-inferentie implementeren met tensor- en pipeline-parallelisme achter Triton
Tags
servingnvidiagpuquantization