Tutto l'open source
Open SourceInferenza10k

Triton Inference Server

Il server di produzione NVIDIA per qualsiasi framework, qualsiasi modello, qualsiasi hardware.

Triton Inference Server è la piattaforma open-source di NVIDIA per il serving di inferenza, che consente di distribuire modelli da qualsiasi framework (TensorRT, PyTorch, TensorFlow, ONNX, Python e altri) su GPU o CPU. Supporta l'esecuzione concorrente di modelli, il dynamic batching, ensemble di modelli ed espone endpoint HTTP/gRPC con metriche integrate. È ampiamente utilizzato come layer di serving in produzione per LLM (tramite il backend TensorRT-LLM) e per il ML tradizionale.

Repository

triton-inference-server/server

Linguaggio

Python

Cosa ci costruiresti

  • Avviare un endpoint di inferenza in produzione che serve modelli da framework misti dietro un'unica API
  • Usare dynamic batching ed esecuzione concorrente di modelli per aumentare l'utilizzo della GPU
  • Servire LLM su larga scala tramite i backend TensorRT-LLM o vLLM con metriche e autoscaling

Tag

servingnvidiaproductionmulti-framework