All åpen kildekode
Åpen kildekodeInferens11k

TensorRT-LLM

NVIDIAs bibliotek for optimalisering og serving av LLM-er på sine GPU-er.

TensorRT-LLM er NVIDIAs åpen kildekode-bibliotek for kompilering og kjøring av optimalisert LLM-inferens på NVIDIA GPU-er. Det tilbyr et Python API for å definere og bygge høyt innstilte TensorRT-motorer med funksjoner som in-flight batching, paginert KV-cache, FP8/INT4-kvantisering og tensor-/pipeline-parallellisme. Det pares med Triton Inference Server-backend for å levere noe av den laveste latensen for LLM-serving på NVIDIA-maskinvare.

Kodelager

NVIDIA/TensorRT-LLM

Språk

C++

Det du kan bygge med den

  • Kompilere LLM-er til optimaliserte TensorRT-motorer for lavest mulig latens på NVIDIA datasenter-GPU-er
  • Serve kvantiserte (FP8/INT4) modeller med in-flight batching for å maksimere GPU-gjennomstrøm
  • Distribuere multi-GPU LLM-inferens med tensor- og pipeline-parallellisme bak Triton

Tagger

servingnvidiagpuquantization