Todo el código abierto
Código abiertoInferencia18k

SGLang

Framework de servicio rápido para LLMs y modelos de lenguaje y visión.

SGLang es un framework de servicio rápido para grandes modelos de lenguaje y visión que combina un runtime optimizado con un lenguaje de generación estructurada. Su runtime incluye RadixAttention para la reutilización automática de cachés KV de prefijo compartido, junto con batching continuo y decodificación estructurada/restringida eficiente. Está orientado al servicio de alto rendimiento de programas LLM complejos con múltiples llamadas y comportamiento agéntico.

Repositorio

sgl-project/sglang

Lenguaje

Python

Lo que construirías con esto

  • Servir LLMs y modelos de lenguaje y visión con alta throughput cuando muchas peticiones comparten prefijos de prompt comunes
  • Implementar programas de prompting complejos (multi-turno, ramificados, llamadas en paralelo) con el DSL de generación estructurada
  • Ejecutar decodificación restringida o estructurada (por ejemplo, salida guiada por esquema JSON) de forma eficiente a escala

Etiquetas

servingthroughputvlm