Alle Open Source
Open SourceInferenz6k

LMDeploy

Toolkit zur Komprimierung und zum Serving von LLMs mit der TurboMind-Engine.

LMDeploy ist ein Open-Source-Toolkit des InternLM-Teams zur Komprimierung, Quantisierung und zum Serving großer Sprach- und Vision-Language-Modelle. Die leistungsstarke TurboMind-Inferenz-Engine bietet Persistent Batching, blockiertes KV-Caching sowie Weight-only- und KV-Quantisierung für hohen Durchsatz; außerdem wird ein OpenAI-kompatibler Server mitgeliefert. Es unterstützt eine breite Palette von Modellfamilien und ist eine beliebte Wahl für effizientes selbst gehostetes LLM-Serving.

Repository

InternLM/lmdeploy

Sprache

Python

Was du damit bauen kannst

  • Quantisierung von LLMs (4-Bit Weight-only, KV-Cache-Quant) und deren Serving mit hohem Durchsatz
  • Selbst-Hosting eines OpenAI-kompatiblen Endpunkts, der von der TurboMind-Engine gestützt wird
  • Effizientes Serving von Vision-Language-Modellen auf einem Single- oder Multi-GPU-Setup

Tags

servingquantizationthroughputvlm