Código abiertoInferencia10k
Triton Inference Server
El servidor de producción de NVIDIA para cualquier framework, modelo y hardware.
Triton Inference Server es la plataforma open-source de NVIDIA para el servicio de inferencia en producción, que permite desplegar modelos de cualquier framework (TensorRT, PyTorch, TensorFlow, ONNX, Python y más) en GPUs o CPUs. Soporta ejecución concurrente de modelos, batching dinámico, ensambles de modelos y expone endpoints HTTP/gRPC con métricas integradas. Es ampliamente utilizado como capa de servicio en producción para LLMs (a través del backend TensorRT-LLM) y para ML tradicional.
Repositorio
triton-inference-server/serverLenguaje
PythonLo que construirías con esto
- Poner en marcha un endpoint de inferencia en producción que sirva modelos de frameworks mixtos detrás de una única API
- Utilizar batching dinámico y ejecución concurrente de modelos para aumentar la utilización de la GPU
- Servir LLMs a escala a través de los backends TensorRT-LLM o vLLM con métricas y autoescalado
Etiquetas
servingnvidiaproductionmulti-framework