Open SourceInferenza11k
TensorRT-LLM
La libreria NVIDIA per ottimizzare e servire LLM sulle sue GPU.
TensorRT-LLM è la libreria open-source di NVIDIA per compilare ed eseguire inferenza LLM ottimizzata su GPU NVIDIA. Fornisce una Python API per definire e costruire engine TensorRT altamente ottimizzati con funzionalità come in-flight batching, paged KV caching, quantizzazione FP8/INT4 e parallelismo tensoriale/pipeline. Si abbina al backend Triton Inference Server per offrire alcune delle latenze più basse nel serving di LLM su hardware NVIDIA.
Repository
NVIDIA/TensorRT-LLMLinguaggio
C++Cosa ci costruiresti
- Compilare LLM in engine TensorRT ottimizzati per la latenza più bassa su GPU NVIDIA datacenter
- Servire modelli quantizzati (FP8/INT4) con in-flight batching per massimizzare il throughput della GPU
- Distribuire inferenza LLM multi-GPU con parallelismo tensoriale e pipeline dietro Triton
Tag
servingnvidiagpuquantization