Open SourceInferenz6k
LMDeploy
Toolkit zur Komprimierung und zum Serving von LLMs mit der TurboMind-Engine.
LMDeploy ist ein Open-Source-Toolkit des InternLM-Teams zur Komprimierung, Quantisierung und zum Serving großer Sprach- und Vision-Language-Modelle. Die leistungsstarke TurboMind-Inferenz-Engine bietet Persistent Batching, blockiertes KV-Caching sowie Weight-only- und KV-Quantisierung für hohen Durchsatz; außerdem wird ein OpenAI-kompatibler Server mitgeliefert. Es unterstützt eine breite Palette von Modellfamilien und ist eine beliebte Wahl für effizientes selbst gehostetes LLM-Serving.
Repository
InternLM/lmdeploySprache
PythonWas du damit bauen kannst
- Quantisierung von LLMs (4-Bit Weight-only, KV-Cache-Quant) und deren Serving mit hohem Durchsatz
- Selbst-Hosting eines OpenAI-kompatiblen Endpunkts, der von der TurboMind-Engine gestützt wird
- Effizientes Serving von Vision-Language-Modellen auf einem Single- oder Multi-GPU-Setup
Tags
servingquantizationthroughputvlm