All åpen kildekode
Åpen kildekodeInferens6k

LMDeploy

Verktøysett for komprimering og serving av LLM-er med TurboMind-motoren.

LMDeploy er et åpen kildekode-verktøysett fra InternLM-teamet for komprimering, kvantering og serving av store språk- og visjonsspråkmodeller. Den høyytende TurboMind-inferensmotoren leverer persistent batching, blokkert KV-caching og vektbasert/KV-kvantering for høy gjennomstrømning, og den leveres med en OpenAI-kompatibel server. Den støtter et bredt spekter av modellfamilier og er et populært valg for effektiv selvhostet LLM-serving.

Kodelager

InternLM/lmdeploy

Språk

Python

Det du kan bygge med den

  • Kvantering av LLM-er (4-bits vektbasert, KV-cache-kvantering) og serving med høy gjennomstrømning
  • Selvhosting av et OpenAI-kompatibelt endepunkt støttet av TurboMind-motoren
  • Effektiv serving av visjonsspråkmodeller på ett eller flere GPU-er

Tagger

servingquantizationthroughputvlm