Open SourceInferenza6k
LMDeploy
Toolkit per comprimere e servire LLM con il motore TurboMind.
LMDeploy è un toolkit open-source del team InternLM per comprimere, quantizzare e servire modelli linguistici e vision-language di grandi dimensioni. Il suo motore di inferenza ad alte prestazioni TurboMind offre persistent batching, blocked KV caching e quantizzazione weight-only/KV per un throughput elevato, e include un server compatibile con OpenAI. Supporta un'ampia gamma di famiglie di modelli ed è una scelta popolare per il serving efficiente di LLM self-hosted.
Repository
InternLM/lmdeployLinguaggio
PythonCosa ci costruiresti
- Quantizzazione di LLM (4-bit weight-only, KV cache quant) e serving con alto throughput
- Self-hosting di un endpoint compatibile con OpenAI basato sul motore TurboMind
- Serving efficiente di modelli vision-language su configurazioni single o multi-GPU
Tag
servingquantizationthroughputvlm