All öppen källkod
Öppen källkodInferens10k

Triton Inference Server

NVIDIAs produktionsserver för vilket ramverk, vilken modell och vilken hårdvara som helst.

Triton Inference Server är NVIDIAs öppna inferensserverplattform för att driftsätta modeller från vilket ramverk som helst (TensorRT, PyTorch, TensorFlow, ONNX, Python och fler) på GPU:er eller CPU:er. Den stöder samtidig modellexekvering, dynamisk batching, modellensembler och exponerar HTTP/gRPC-endpoints med inbyggda mätvärden. Den används i stor utsträckning som produktionsservningslager för LLM:er (via TensorRT-LLM-backend) och traditionell ML.

Kodförråd

triton-inference-server/server

Språk

Python

Vad du kan bygga med det

  • Sätt upp en produktionsinferensendpoint som servar modeller från blandade ramverk bakom ett API
  • Använd dynamisk batching och samtidig modellexekvering för att öka GPU-utnyttjandet
  • Serva LLM:er i stor skala via TensorRT-LLM- eller vLLM-backends med mätvärden och autoskalning

Taggar

servingnvidiaproductionmulti-framework