Todo el código abierto
Código abiertoInferencia10k

Triton Inference Server

El servidor de producción de NVIDIA para cualquier framework, modelo y hardware.

Triton Inference Server es la plataforma open-source de NVIDIA para el servicio de inferencia en producción, que permite desplegar modelos de cualquier framework (TensorRT, PyTorch, TensorFlow, ONNX, Python y más) en GPUs o CPUs. Soporta ejecución concurrente de modelos, batching dinámico, ensambles de modelos y expone endpoints HTTP/gRPC con métricas integradas. Es ampliamente utilizado como capa de servicio en producción para LLMs (a través del backend TensorRT-LLM) y para ML tradicional.

Repositorio

triton-inference-server/server

Lenguaje

Python

Lo que construirías con esto

  • Poner en marcha un endpoint de inferencia en producción que sirva modelos de frameworks mixtos detrás de una única API
  • Utilizar batching dinámico y ejecución concurrente de modelos para aumentar la utilización de la GPU
  • Servir LLMs a escala a través de los backends TensorRT-LLM o vLLM con métricas y autoescalado

Etiquetas

servingnvidiaproductionmulti-framework