Alle open source
Open SourceInferentie10k

Triton Inference Server

NVIDIA's productieserver voor elk framework, elk model, elke hardware.

Triton Inference Server is NVIDIA's open-source inferentieservingplatform voor het implementeren van modellen uit elk framework (TensorRT, PyTorch, TensorFlow, ONNX, Python en meer) op GPU's of CPU's. Het ondersteunt gelijktijdige modeluitvoering, dynamisch batchen, modelensembles en biedt HTTP/gRPC-endpoints met ingebouwde metrics. Het wordt veel gebruikt als productieservinglaag voor LLM's (via de TensorRT-LLM-backend) en traditionele ML.

Opslagplaats

triton-inference-server/server

Taal

Python

Wat je ermee zou bouwen

  • Een productie-inferentie-endpoint opzetten dat modellen uit gemengde frameworks achter één API bedient
  • Dynamisch batchen en gelijktijdige modeluitvoering gebruiken om GPU-benutting te verhogen
  • LLM's op schaal serveren via de TensorRT-LLM- of vLLM-backends met metrics en automatisch schalen

Tags

servingnvidiaproductionmulti-framework