Código abiertoInferencia37k
Ray Serve / Ray
Framework distribuido para escalar el servicio de modelos y cargas de trabajo de IA.
Ray es un framework de código abierto para escalar aplicaciones Python e IA. Su librería Ray Serve proporciona una capa de servicio de modelos escalable e independiente del framework. Ray Serve permite componer múltiples modelos en grafos de despliegue, autoescalado, asignación fraccionada de GPU y procesamiento por lotes, e incluye servicio específico para LLMs con una API compatible con OpenAI respaldada por motores como vLLM. Se usa ampliamente para servir y orquestar inferencia a escala en clústeres.
Repositorio
ray-project/rayLenguaje
PythonLo que construirías con esto
- Servir y autoescalar LLMs en un clúster con una API compatible con OpenAI respaldada por vLLM
- Componer pipelines de inferencia multi-modelo (recuperación, clasificación, generación) como un único grafo de despliegue
- Ejecutar inferencia por lotes y servicio online en el mismo clúster Ray con asignación fraccionada de GPU
Etiquetas
servingdistributedscalinggpu