Código abiertoInferencia11k
TensorRT-LLM
La biblioteca de NVIDIA para optimizar y servir LLMs en sus GPUs.
TensorRT-LLM es la biblioteca open-source de NVIDIA para compilar y ejecutar inferencia LLM optimizada en GPUs NVIDIA. Proporciona una API Python para definir y construir motores TensorRT altamente ajustados con características como in-flight batching, caché KV paginada, cuantización FP8/INT4 y paralelismo de tensores y de pipeline. Se combina con el backend del Triton Inference Server para ofrecer una de las latencias más bajas en el servicio de LLMs sobre hardware NVIDIA.
Repositorio
NVIDIA/TensorRT-LLMLenguaje
C++Lo que construirías con esto
- Compilar LLMs en motores TensorRT optimizados para la menor latencia en GPUs de centros de datos NVIDIA
- Servir modelos cuantizados (FP8/INT4) con in-flight batching para maximizar el rendimiento de la GPU
- Desplegar inferencia LLM multi-GPU con paralelismo de tensores y de pipeline detrás de Triton
Etiquetas
servingnvidiagpuquantization