Open SourceInferenza10k
Triton Inference Server
Il server di produzione NVIDIA per qualsiasi framework, qualsiasi modello, qualsiasi hardware.
Triton Inference Server è la piattaforma open-source di NVIDIA per il serving di inferenza, che consente di distribuire modelli da qualsiasi framework (TensorRT, PyTorch, TensorFlow, ONNX, Python e altri) su GPU o CPU. Supporta l'esecuzione concorrente di modelli, il dynamic batching, ensemble di modelli ed espone endpoint HTTP/gRPC con metriche integrate. È ampiamente utilizzato come layer di serving in produzione per LLM (tramite il backend TensorRT-LLM) e per il ML tradizionale.
Repository
triton-inference-server/serverLinguaggio
PythonCosa ci costruiresti
- Avviare un endpoint di inferenza in produzione che serve modelli da framework misti dietro un'unica API
- Usare dynamic batching ed esecuzione concorrente di modelli per aumentare l'utilizzo della GPU
- Servire LLM su larga scala tramite i backend TensorRT-LLM o vLLM con metriche e autoscaling
Tag
servingnvidiaproductionmulti-framework