Tüm açık kaynaklar
Açık KaynakÇıkarım10k

Triton Inference Server

NVIDIA'nın her çerçeve, her model ve her donanım için üretim sunucusu.

Triton Inference Server, GPU veya CPU'larda herhangi bir çerçeveden (TensorRT, PyTorch, TensorFlow, ONNX, Python ve daha fazlası) modelleri dağıtmak için NVIDIA'nın açık kaynaklı çıkarım sunumu platformudur. Eşzamanlı model yürütmeyi, dinamik toplu işlemeyi, model topluluklarını destekler ve yerleşik metriklerle HTTP/gRPC uç noktaları sunar. LLM'lerin (TensorRT-LLM arka ucu aracılığıyla) ve geleneksel ML'nin üretim sunumu katmanı olarak yaygın biçimde kullanılır.

Depo

triton-inference-server/server

Dil

Python

Bununla neler kurabilirsin

  • Karma çerçevelerden gelen modelleri tek bir API arkasında sunan bir üretim çıkarım uç noktası kurun
  • GPU kullanımını artırmak için dinamik toplu işleme ve eşzamanlı model yürütme kullanın
  • TensorRT-LLM veya vLLM arka uçları aracılığıyla metrikler ve otomatik ölçeklendirmeyle LLM'leri ölçekte sunun

Etiketler

servingnvidiaproductionmulti-framework