Alle Open Source
Open SourceInferenz11k

TensorRT-LLM

NVIDIAs Bibliothek zur Optimierung und zum Serving von LLMs auf seinen GPUs.

TensorRT-LLM ist NVIDIAs Open-Source-Bibliothek zum Kompilieren und Ausführen von optimierter LLM-Inferenz auf NVIDIA-GPUs. Sie bietet eine Python-API zum Definieren und Erstellen von hochoptimierten TensorRT-Engines mit Funktionen wie In-Flight-Batching, Paged-KV-Caching, FP8/INT4-Quantisierung sowie Tensor- und Pipeline-Parallelismus. In Kombination mit dem Triton-Inference-Server-Backend ermöglicht sie LLM-Serving mit extrem niedriger Latenz auf NVIDIA-Hardware.

Repository

NVIDIA/TensorRT-LLM

Sprache

C++

Was du damit bauen kannst

  • LLMs in optimierte TensorRT-Engines kompilieren, um die niedrigste Latenz auf NVIDIA-Rechenzentrum-GPUs zu erreichen
  • Quantisierte (FP8/INT4) Modelle mit In-Flight-Batching serving, um den GPU-Durchsatz zu maximieren
  • Multi-GPU-LLM-Inferenz mit Tensor- und Pipeline-Parallelismus hinter Triton deployen

Tags

servingnvidiagpuquantization