Tout l'open source
Open SourceInférence10k

Triton Inference Server

Le serveur de production NVIDIA pour tout framework, tout modèle, tout matériel.

Triton Inference Server est la plateforme open-source de NVIDIA pour déployer des modèles issus de n'importe quel framework (TensorRT, PyTorch, TensorFlow, ONNX, Python, et plus encore) sur GPU ou CPU. Il prend en charge l'exécution concurrente de modèles, le batching dynamique, les ensembles de modèles et expose des endpoints HTTP/gRPC avec des métriques intégrées. Il est largement utilisé comme couche de service en production pour les LLM (via le backend TensorRT-LLM) et le ML classique.

Dépôt

triton-inference-server/server

Langage

Python

Ce que vous pourriez construire avec

  • Mettre en place un endpoint d'inférence en production servant des modèles de frameworks mixtes derrière une seule API
  • Utiliser le batching dynamique et l'exécution concurrente de modèles pour augmenter l'utilisation du GPU
  • Servir des LLM à grande échelle via les backends TensorRT-LLM ou vLLM avec métriques et mise à l'échelle automatique

Tags

servingnvidiaproductionmulti-framework