Todo el c贸digo abierto
C贸digo abiertoInferencia6k

LMDeploy

Toolkit para comprimir y servir LLMs con el motor TurboMind.

LMDeploy es un toolkit de c贸digo abierto del equipo InternLM para comprimir, cuantizar y servir modelos de lenguaje y visi贸n-lenguaje de gran tama帽o. Su motor de inferencia de alto rendimiento TurboMind ofrece procesamiento por lotes persistente, cach茅 KV por bloques y cuantizaci贸n de pesos/KV para maximizar el rendimiento, e incluye un servidor compatible con OpenAI. Soporta una amplia variedad de familias de modelos y es una opci贸n popular para el servicio eficiente de LLMs auto-alojados.

Repositorio

InternLM/lmdeploy

Lenguaje

Python

Lo que construir铆as con esto

  • Cuantizar LLMs (solo pesos a 4 bits, cuantizaci贸n de cach茅 KV) y servirlos con alto rendimiento
  • Auto-alojar un endpoint compatible con OpenAI respaldado por el motor TurboMind
  • Servir modelos visi贸n-lenguaje de forma eficiente en configuraciones de una o varias GPU

Etiquetas

servingquantizationthroughputvlm