Åpen kildekodeInferens6k
LMDeploy
Verktøysett for komprimering og serving av LLM-er med TurboMind-motoren.
LMDeploy er et åpen kildekode-verktøysett fra InternLM-teamet for komprimering, kvantering og serving av store språk- og visjonsspråkmodeller. Den høyytende TurboMind-inferensmotoren leverer persistent batching, blokkert KV-caching og vektbasert/KV-kvantering for høy gjennomstrømning, og den leveres med en OpenAI-kompatibel server. Den støtter et bredt spekter av modellfamilier og er et populært valg for effektiv selvhostet LLM-serving.
Kodelager
InternLM/lmdeploySpråk
PythonDet du kan bygge med den
- Kvantering av LLM-er (4-bits vektbasert, KV-cache-kvantering) og serving med høy gjennomstrømning
- Selvhosting av et OpenAI-kompatibelt endepunkt støttet av TurboMind-motoren
- Effektiv serving av visjonsspråkmodeller på ett eller flere GPU-er
Tagger
servingquantizationthroughputvlm