Tutto l'open source
Open SourceInferenza11k

TensorRT-LLM

La libreria NVIDIA per ottimizzare e servire LLM sulle sue GPU.

TensorRT-LLM è la libreria open-source di NVIDIA per compilare ed eseguire inferenza LLM ottimizzata su GPU NVIDIA. Fornisce una Python API per definire e costruire engine TensorRT altamente ottimizzati con funzionalità come in-flight batching, paged KV caching, quantizzazione FP8/INT4 e parallelismo tensoriale/pipeline. Si abbina al backend Triton Inference Server per offrire alcune delle latenze più basse nel serving di LLM su hardware NVIDIA.

Repository

NVIDIA/TensorRT-LLM

Linguaggio

C++

Cosa ci costruiresti

  • Compilare LLM in engine TensorRT ottimizzati per la latenza più bassa su GPU NVIDIA datacenter
  • Servire modelli quantizzati (FP8/INT4) con in-flight batching per massimizzare il throughput della GPU
  • Distribuire inferenza LLM multi-GPU con parallelismo tensoriale e pipeline dietro Triton

Tag

servingnvidiagpuquantization