Tutto l'open source
Open SourceInferenza6k

LMDeploy

Toolkit per comprimere e servire LLM con il motore TurboMind.

LMDeploy è un toolkit open-source del team InternLM per comprimere, quantizzare e servire modelli linguistici e vision-language di grandi dimensioni. Il suo motore di inferenza ad alte prestazioni TurboMind offre persistent batching, blocked KV caching e quantizzazione weight-only/KV per un throughput elevato, e include un server compatibile con OpenAI. Supporta un'ampia gamma di famiglie di modelli ed è una scelta popolare per il serving efficiente di LLM self-hosted.

Repository

InternLM/lmdeploy

Linguaggio

Python

Cosa ci costruiresti

  • Quantizzazione di LLM (4-bit weight-only, KV cache quant) e serving con alto throughput
  • Self-hosting di un endpoint compatibile con OpenAI basato sul motore TurboMind
  • Serving efficiente di modelli vision-language su configurazioni single o multi-GPU

Tag

servingquantizationthroughputvlm