Todo el código abierto
Código abiertoInferencia37k

Ray Serve / Ray

Framework distribuido para escalar el servicio de modelos y cargas de trabajo de IA.

Ray es un framework de código abierto para escalar aplicaciones Python e IA. Su librería Ray Serve proporciona una capa de servicio de modelos escalable e independiente del framework. Ray Serve permite componer múltiples modelos en grafos de despliegue, autoescalado, asignación fraccionada de GPU y procesamiento por lotes, e incluye servicio específico para LLMs con una API compatible con OpenAI respaldada por motores como vLLM. Se usa ampliamente para servir y orquestar inferencia a escala en clústeres.

Repositorio

ray-project/ray

Lenguaje

Python

Lo que construirías con esto

  • Servir y autoescalar LLMs en un clúster con una API compatible con OpenAI respaldada por vLLM
  • Componer pipelines de inferencia multi-modelo (recuperación, clasificación, generación) como un único grafo de despliegue
  • Ejecutar inferencia por lotes y servicio online en el mismo clúster Ray con asignación fraccionada de GPU

Etiquetas

servingdistributedscalinggpu