Open SourceInferentie10k
Triton Inference Server
NVIDIA's productieserver voor elk framework, elk model, elke hardware.
Triton Inference Server is NVIDIA's open-source inferentieservingplatform voor het implementeren van modellen uit elk framework (TensorRT, PyTorch, TensorFlow, ONNX, Python en meer) op GPU's of CPU's. Het ondersteunt gelijktijdige modeluitvoering, dynamisch batchen, modelensembles en biedt HTTP/gRPC-endpoints met ingebouwde metrics. Het wordt veel gebruikt als productieservinglaag voor LLM's (via de TensorRT-LLM-backend) en traditionele ML.
Opslagplaats
triton-inference-server/serverTaal
PythonWat je ermee zou bouwen
- Een productie-inferentie-endpoint opzetten dat modellen uit gemengde frameworks achter één API bedient
- Dynamisch batchen en gelijktijdige modeluitvoering gebruiken om GPU-benutting te verhogen
- LLM's op schaal serveren via de TensorRT-LLM- of vLLM-backends met metrics en automatisch schalen
Tags
servingnvidiaproductionmulti-framework