Código abiertoInferencia18k
SGLang
Framework de servicio rápido para LLMs y modelos de lenguaje y visión.
SGLang es un framework de servicio rápido para grandes modelos de lenguaje y visión que combina un runtime optimizado con un lenguaje de generación estructurada. Su runtime incluye RadixAttention para la reutilización automática de cachés KV de prefijo compartido, junto con batching continuo y decodificación estructurada/restringida eficiente. Está orientado al servicio de alto rendimiento de programas LLM complejos con múltiples llamadas y comportamiento agéntico.
Repositorio
sgl-project/sglangLenguaje
PythonLo que construirías con esto
- Servir LLMs y modelos de lenguaje y visión con alta throughput cuando muchas peticiones comparten prefijos de prompt comunes
- Implementar programas de prompting complejos (multi-turno, ramificados, llamadas en paralelo) con el DSL de generación estructurada
- Ejecutar decodificación restringida o estructurada (por ejemplo, salida guiada por esquema JSON) de forma eficiente a escala
Etiquetas
servingthroughputvlm