Öppen källkodInferens6k
LMDeploy
Verktygssvit för komprimering och serving av LLMs med TurboMind-motorn.
LMDeploy är en open source-verktygssvit från InternLM-teamet för komprimering, kvantiering och serving av stora språk- och vision-språkmodeller. Dess högpresterande TurboMind-inferensmotor levererar persistent batchning, blockerad KV-cachning och vikt- och KV-kvantiering för hög genomströmning, och den levereras med en OpenAI-kompatibel server. Den stödjer ett brett spektrum av modellfamiljer och är ett populärt val för effektiv självhostad LLM-serving.
Kodförråd
InternLM/lmdeploySpråk
PythonVad du kan bygga med det
- Kvantiera LLMs (4-bitars viktbaserad kvantiering, KV-cache-kvant) och driftsätta dem med hög genomströmning
- Självhosta en OpenAI-kompatibel endpoint backat av TurboMind-motorn
- Driftsätta vision-språkmodeller effektivt på en eller flera GPU:er
Taggar
servingquantizationthroughputvlm