كل المشاريع مفتوحة المصدر
مفتوح المصدراستدلال6k

LMDeploy

Toolkit voor het comprimeren en serveren van LLM's met de TurboMind-engine.

LMDeploy is een open-source toolkit van het InternLM-team voor het comprimeren, kwantiseren en serveren van grote taal- en vision-language-modellen. De krachtige TurboMind-inferentie-engine levert persistent batching, geblokkeerde KV-caching en weight-only/KV-kwantisatie voor hoge doorvoer, en bevat een OpenAI-compatibele server. Het ondersteunt een breed scala aan modelfamilies en is een populaire keuze voor efficiënte self-hosted LLM-serving.

المستودع

InternLM/lmdeploy

اللغة

Python

ما الذي يمكنك بناؤه به

  • Kwantiseren van LLM's (4-bit weight-only, KV cache kwantisatie) en serveren met hoge doorvoer
  • Self-hosten van een OpenAI-compatibel endpoint ondersteund door de TurboMind-engine
  • Efficiënt serveren van vision-language-modellen op een single- of multi-GPU-setup

الوسوم

servingquantizationthroughputvlm