Åpen kildekodeInferens11k
TensorRT-LLM
NVIDIAs bibliotek for optimalisering og serving av LLM-er på sine GPU-er.
TensorRT-LLM er NVIDIAs åpen kildekode-bibliotek for kompilering og kjøring av optimalisert LLM-inferens på NVIDIA GPU-er. Det tilbyr et Python API for å definere og bygge høyt innstilte TensorRT-motorer med funksjoner som in-flight batching, paginert KV-cache, FP8/INT4-kvantisering og tensor-/pipeline-parallellisme. Det pares med Triton Inference Server-backend for å levere noe av den laveste latensen for LLM-serving på NVIDIA-maskinvare.
Kodelager
NVIDIA/TensorRT-LLMSpråk
C++Det du kan bygge med den
- Kompilere LLM-er til optimaliserte TensorRT-motorer for lavest mulig latens på NVIDIA datasenter-GPU-er
- Serve kvantiserte (FP8/INT4) modeller med in-flight batching for å maksimere GPU-gjennomstrøm
- Distribuere multi-GPU LLM-inferens med tensor- og pipeline-parallellisme bak Triton
Tagger
servingnvidiagpuquantization