Öppen källkodInferens11k
TensorRT-LLM
NVIDIAs bibliotek för att optimera och serva LLM:er på dess GPU:er.
TensorRT-LLM är NVIDIAs öppna bibliotek för att kompilera och köra optimerad LLM-inferens på NVIDIA GPU:er. Det tillhandahåller ett Python-API för att definiera och bygga högt optimerade TensorRT-motorer med funktioner som in-flight batching, paginerad KV-cachning, FP8/INT4-kvantisering och tensor-/pipelineparallelism. Det kombineras med Triton Inference Server-backend för att leverera en av de lägsta latenserna vid LLM-servning på NVIDIA-hårdvara.
Kodförråd
NVIDIA/TensorRT-LLMSpråk
C++Vad du kan bygga med det
- Kompilera LLM:er till optimerade TensorRT-motorer för lägsta latens på NVIDIA datacenter-GPU:er
- Serva kvantiserade (FP8/INT4) modeller med in-flight batching för att maximera GPU-genomströmning
- Driftsätt multi-GPU LLM-inferens med tensor- och pipelineparallelism bakom Triton
Taggar
servingnvidiagpuquantization