C贸digo abiertoInferencia6k
LMDeploy
Toolkit para comprimir y servir LLMs con el motor TurboMind.
LMDeploy es un toolkit de c贸digo abierto del equipo InternLM para comprimir, cuantizar y servir modelos de lenguaje y visi贸n-lenguaje de gran tama帽o. Su motor de inferencia de alto rendimiento TurboMind ofrece procesamiento por lotes persistente, cach茅 KV por bloques y cuantizaci贸n de pesos/KV para maximizar el rendimiento, e incluye un servidor compatible con OpenAI. Soporta una amplia variedad de familias de modelos y es una opci贸n popular para el servicio eficiente de LLMs auto-alojados.
Repositorio
InternLM/lmdeployLenguaje
PythonLo que construir铆as con esto
- Cuantizar LLMs (solo pesos a 4 bits, cuantizaci贸n de cach茅 KV) y servirlos con alto rendimiento
- Auto-alojar un endpoint compatible con OpenAI respaldado por el motor TurboMind
- Servir modelos visi贸n-lenguaje de forma eficiente en configuraciones de una o varias GPU
Etiquetas
servingquantizationthroughputvlm