Alle Open Source
Open SourceInferenz10k

Triton Inference Server

NVIDIAs Produktionsserver für jedes Framework, jedes Modell, jede Hardware.

Triton Inference Server ist NVIDIAs Open-Source-Inferenz-Serving-Plattform für das Deployen von Modellen aus beliebigen Frameworks (TensorRT, PyTorch, TensorFlow, ONNX, Python und weitere) auf GPUs oder CPUs. Er unterstützt parallele Modellausführung, dynamisches Batching, Modell-Ensembles und stellt HTTP/gRPC-Endpunkte mit integrierten Metriken bereit. Er wird verbreitet als Produktions-Serving-Layer für LLMs (über das TensorRT-LLM-Backend) und klassische ML-Modelle gleichermaßen eingesetzt.

Repository

triton-inference-server/server

Sprache

Python

Was du damit bauen kannst

  • Einen Produktions-Inferenz-Endpunkt aufsetzen, der Modelle aus gemischten Frameworks hinter einer API bereitstellt
  • Dynamisches Batching und parallele Modellausführung nutzen, um die GPU-Auslastung zu steigern
  • LLMs im großen Maßstab über das TensorRT-LLM- oder vLLM-Backend mit Metriken und Autoscaling serving

Tags

servingnvidiaproductionmulti-framework