Åpen kildekodeInferens10k
Triton Inference Server
NVIDIAs produksjonsserver for ethvert rammeverk, enhver modell, enhver maskinvare.
Triton Inference Server er NVIDIAs åpen kildekode inferensserveringsplattform for å distribuere modeller fra ethvert rammeverk (TensorRT, PyTorch, TensorFlow, ONNX, Python og mer) på GPU-er eller CPU-er. Den støtter simultane modellkjøringer, dynamisk batching, modellensembler og eksponerer HTTP/gRPC-endepunkter med innebygde metrikker. Den er mye brukt som produksjonsserveringslag for LLM-er (via TensorRT-LLM-backend) og tradisjonell ML.
Kodelager
triton-inference-server/serverSpråk
PythonDet du kan bygge med den
- Sette opp et produksjonsinferensendepunkt som server modeller fra blandede rammeverk bak ett API
- Bruke dynamisk batching og simultane modellkjøringer for å øke GPU-utnyttelsen
- Serve LLM-er i stor skala gjennom TensorRT-LLM- eller vLLM-backend med metrikker og autoskalering
Tagger
servingnvidiaproductionmulti-framework