Todo el código abierto
Código abiertoInferencia11k

TensorRT-LLM

La biblioteca de NVIDIA para optimizar y servir LLMs en sus GPUs.

TensorRT-LLM es la biblioteca open-source de NVIDIA para compilar y ejecutar inferencia LLM optimizada en GPUs NVIDIA. Proporciona una API Python para definir y construir motores TensorRT altamente ajustados con características como in-flight batching, caché KV paginada, cuantización FP8/INT4 y paralelismo de tensores y de pipeline. Se combina con el backend del Triton Inference Server para ofrecer una de las latencias más bajas en el servicio de LLMs sobre hardware NVIDIA.

Repositorio

NVIDIA/TensorRT-LLM

Lenguaje

C++

Lo que construirías con esto

  • Compilar LLMs en motores TensorRT optimizados para la menor latencia en GPUs de centros de datos NVIDIA
  • Servir modelos cuantizados (FP8/INT4) con in-flight batching para maximizar el rendimiento de la GPU
  • Desplegar inferencia LLM multi-GPU con paralelismo de tensores y de pipeline detrás de Triton

Etiquetas

servingnvidiagpuquantization