All öppen källkod
Öppen källkodInferens6k

LMDeploy

Verktygssvit för komprimering och serving av LLMs med TurboMind-motorn.

LMDeploy är en open source-verktygssvit från InternLM-teamet för komprimering, kvantiering och serving av stora språk- och vision-språkmodeller. Dess högpresterande TurboMind-inferensmotor levererar persistent batchning, blockerad KV-cachning och vikt- och KV-kvantiering för hög genomströmning, och den levereras med en OpenAI-kompatibel server. Den stödjer ett brett spektrum av modellfamiljer och är ett populärt val för effektiv självhostad LLM-serving.

Kodförråd

InternLM/lmdeploy

Språk

Python

Vad du kan bygga med det

  • Kvantiera LLMs (4-bitars viktbaserad kvantiering, KV-cache-kvant) och driftsätta dem med hög genomströmning
  • Självhosta en OpenAI-kompatibel endpoint backat av TurboMind-motorn
  • Driftsätta vision-språkmodeller effektivt på en eller flera GPU:er

Taggar

servingquantizationthroughputvlm