Open SourceInférence6k
LMDeploy
Boîte à outils pour la compression et le serving de LLM avec le moteur TurboMind.
LMDeploy est une boîte à outils open source de l'équipe InternLM pour la compression, la quantification et le serving de grands modèles de langage et de vision-langage. Son moteur d'inférence haute performance TurboMind offre du persistent batching, un cache KV par blocs et une quantification poids-only/KV pour un débit élevé, avec un serveur compatible OpenAI inclus. Il prend en charge un large éventail de familles de modèles et constitue un choix populaire pour un serving LLM auto-hébergé efficace.
Dépôt
InternLM/lmdeployLangage
PythonCe que vous pourriez construire avec
- Quantifier des LLM (poids-only 4 bits, quant KV cache) et les servir avec un débit élevé
- Auto-héberger un endpoint compatible OpenAI propulsé par le moteur TurboMind
- Servir des modèles vision-langage efficacement sur une configuration mono ou multi-GPU
Tags
servingquantizationthroughputvlm