All öppen källkod
Öppen källkodInferens11k

TensorRT-LLM

NVIDIAs bibliotek för att optimera och serva LLM:er på dess GPU:er.

TensorRT-LLM är NVIDIAs öppna bibliotek för att kompilera och köra optimerad LLM-inferens på NVIDIA GPU:er. Det tillhandahåller ett Python-API för att definiera och bygga högt optimerade TensorRT-motorer med funktioner som in-flight batching, paginerad KV-cachning, FP8/INT4-kvantisering och tensor-/pipelineparallelism. Det kombineras med Triton Inference Server-backend för att leverera en av de lägsta latenserna vid LLM-servning på NVIDIA-hårdvara.

Kodförråd

NVIDIA/TensorRT-LLM

Språk

C++

Vad du kan bygga med det

  • Kompilera LLM:er till optimerade TensorRT-motorer för lägsta latens på NVIDIA datacenter-GPU:er
  • Serva kvantiserade (FP8/INT4) modeller med in-flight batching för att maximera GPU-genomströmning
  • Driftsätt multi-GPU LLM-inferens med tensor- och pipelineparallelism bakom Triton

Taggar

servingnvidiagpuquantization