Açık KaynakÇıkarım10k
Triton Inference Server
NVIDIA'nın her çerçeve, her model ve her donanım için üretim sunucusu.
Triton Inference Server, GPU veya CPU'larda herhangi bir çerçeveden (TensorRT, PyTorch, TensorFlow, ONNX, Python ve daha fazlası) modelleri dağıtmak için NVIDIA'nın açık kaynaklı çıkarım sunumu platformudur. Eşzamanlı model yürütmeyi, dinamik toplu işlemeyi, model topluluklarını destekler ve yerleşik metriklerle HTTP/gRPC uç noktaları sunar. LLM'lerin (TensorRT-LLM arka ucu aracılığıyla) ve geleneksel ML'nin üretim sunumu katmanı olarak yaygın biçimde kullanılır.
Depo
triton-inference-server/serverDil
PythonBununla neler kurabilirsin
- Karma çerçevelerden gelen modelleri tek bir API arkasında sunan bir üretim çıkarım uç noktası kurun
- GPU kullanımını artırmak için dinamik toplu işleme ve eşzamanlı model yürütme kullanın
- TensorRT-LLM veya vLLM arka uçları aracılığıyla metrikler ve otomatik ölçeklendirmeyle LLM'leri ölçekte sunun
Etiketler
servingnvidiaproductionmulti-framework