مفتوح المصدراستدلال6k
LMDeploy
Toolkit voor het comprimeren en serveren van LLM's met de TurboMind-engine.
LMDeploy is een open-source toolkit van het InternLM-team voor het comprimeren, kwantiseren en serveren van grote taal- en vision-language-modellen. De krachtige TurboMind-inferentie-engine levert persistent batching, geblokkeerde KV-caching en weight-only/KV-kwantisatie voor hoge doorvoer, en bevat een OpenAI-compatibele server. Het ondersteunt een breed scala aan modelfamilies en is een populaire keuze voor efficiënte self-hosted LLM-serving.
المستودع
InternLM/lmdeployاللغة
Pythonما الذي يمكنك بناؤه به
- Kwantiseren van LLM's (4-bit weight-only, KV cache kwantisatie) en serveren met hoge doorvoer
- Self-hosten van een OpenAI-compatibel endpoint ondersteund door de TurboMind-engine
- Efficiënt serveren van vision-language-modellen op een single- of multi-GPU-setup
الوسوم
servingquantizationthroughputvlm