Open SourceInférence11k
TensorRT-LLM
La bibliothèque NVIDIA pour optimiser et servir les LLM sur ses GPU.
TensorRT-LLM est la bibliothèque open-source de NVIDIA pour compiler et exécuter une inférence LLM optimisée sur les GPU NVIDIA. Elle fournit une API Python pour définir et construire des moteurs TensorRT hautement optimisés avec des fonctionnalités comme le batching en vol, la mise en cache KV paginée, la quantification FP8/INT4 et le parallélisme tensoriel et de pipeline. Elle s'associe au backend du Triton Inference Server pour offrir certaines des latences LLM les plus faibles sur le matériel NVIDIA.
Dépôt
NVIDIA/TensorRT-LLMLangage
C++Ce que vous pourriez construire avec
- Compiler des LLM en moteurs TensorRT optimisés pour la latence la plus faible sur les GPU NVIDIA de datacenter
- Servir des modèles quantifiés (FP8/INT4) avec du batching en vol pour maximiser le débit GPU
- Déployer une inférence LLM multi-GPU avec parallélisme tensoriel et de pipeline derrière Triton
Tags
servingnvidiagpuquantization