All åpen kildekode
Åpen kildekodeInferens10k

Triton Inference Server

NVIDIAs produksjonsserver for ethvert rammeverk, enhver modell, enhver maskinvare.

Triton Inference Server er NVIDIAs åpen kildekode inferensserveringsplattform for å distribuere modeller fra ethvert rammeverk (TensorRT, PyTorch, TensorFlow, ONNX, Python og mer) på GPU-er eller CPU-er. Den støtter simultane modellkjøringer, dynamisk batching, modellensembler og eksponerer HTTP/gRPC-endepunkter med innebygde metrikker. Den er mye brukt som produksjonsserveringslag for LLM-er (via TensorRT-LLM-backend) og tradisjonell ML.

Kodelager

triton-inference-server/server

Språk

Python

Det du kan bygge med den

  • Sette opp et produksjonsinferensendepunkt som server modeller fra blandede rammeverk bak ett API
  • Bruke dynamisk batching og simultane modellkjøringer for å øke GPU-utnyttelsen
  • Serve LLM-er i stor skala gjennom TensorRT-LLM- eller vLLM-backend med metrikker og autoskalering

Tagger

servingnvidiaproductionmulti-framework