Open SourceInferenz11k
TensorRT-LLM
NVIDIAs Bibliothek zur Optimierung und zum Serving von LLMs auf seinen GPUs.
TensorRT-LLM ist NVIDIAs Open-Source-Bibliothek zum Kompilieren und Ausführen von optimierter LLM-Inferenz auf NVIDIA-GPUs. Sie bietet eine Python-API zum Definieren und Erstellen von hochoptimierten TensorRT-Engines mit Funktionen wie In-Flight-Batching, Paged-KV-Caching, FP8/INT4-Quantisierung sowie Tensor- und Pipeline-Parallelismus. In Kombination mit dem Triton-Inference-Server-Backend ermöglicht sie LLM-Serving mit extrem niedriger Latenz auf NVIDIA-Hardware.
Repository
NVIDIA/TensorRT-LLMSprache
C++Was du damit bauen kannst
- LLMs in optimierte TensorRT-Engines kompilieren, um die niedrigste Latenz auf NVIDIA-Rechenzentrum-GPUs zu erreichen
- Quantisierte (FP8/INT4) Modelle mit In-Flight-Batching serving, um den GPU-Durchsatz zu maximieren
- Multi-GPU-LLM-Inferenz mit Tensor- und Pipeline-Parallelismus hinter Triton deployen
Tags
servingnvidiagpuquantization