Open SourceInférence10k
Triton Inference Server
Le serveur de production NVIDIA pour tout framework, tout modèle, tout matériel.
Triton Inference Server est la plateforme open-source de NVIDIA pour déployer des modèles issus de n'importe quel framework (TensorRT, PyTorch, TensorFlow, ONNX, Python, et plus encore) sur GPU ou CPU. Il prend en charge l'exécution concurrente de modèles, le batching dynamique, les ensembles de modèles et expose des endpoints HTTP/gRPC avec des métriques intégrées. Il est largement utilisé comme couche de service en production pour les LLM (via le backend TensorRT-LLM) et le ML classique.
Dépôt
triton-inference-server/serverLangage
PythonCe que vous pourriez construire avec
- Mettre en place un endpoint d'inférence en production servant des modèles de frameworks mixtes derrière une seule API
- Utiliser le batching dynamique et l'exécution concurrente de modèles pour augmenter l'utilisation du GPU
- Servir des LLM à grande échelle via les backends TensorRT-LLM ou vLLM avec métriques et mise à l'échelle automatique
Tags
servingnvidiaproductionmulti-framework