Open SourceInferenz10k
Triton Inference Server
NVIDIAs Produktionsserver für jedes Framework, jedes Modell, jede Hardware.
Triton Inference Server ist NVIDIAs Open-Source-Inferenz-Serving-Plattform für das Deployen von Modellen aus beliebigen Frameworks (TensorRT, PyTorch, TensorFlow, ONNX, Python und weitere) auf GPUs oder CPUs. Er unterstützt parallele Modellausführung, dynamisches Batching, Modell-Ensembles und stellt HTTP/gRPC-Endpunkte mit integrierten Metriken bereit. Er wird verbreitet als Produktions-Serving-Layer für LLMs (über das TensorRT-LLM-Backend) und klassische ML-Modelle gleichermaßen eingesetzt.
Repository
triton-inference-server/serverSprache
PythonWas du damit bauen kannst
- Einen Produktions-Inferenz-Endpunkt aufsetzen, der Modelle aus gemischten Frameworks hinter einer API bereitstellt
- Dynamisches Batching und parallele Modellausführung nutzen, um die GPU-Auslastung zu steigern
- LLMs im großen Maßstab über das TensorRT-LLM- oder vLLM-Backend mit Metriken und Autoscaling serving
Tags
servingnvidiaproductionmulti-framework