Open SourceInférence37k
Ray Serve / Ray
Framework distribué pour le passage à l'échelle du serving de modèles et des charges de travail IA.
Ray est un framework open source pour faire passer à l'échelle les applications Python et IA. Sa bibliothèque Ray Serve fournit une couche de serving de modèles scalable et agnostique au framework. Ray Serve prend en charge la composition de plusieurs modèles en graphes de déploiement, l'autoscaling, l'allocation fractionnée de GPU et le batching, avec un serving LLM dédié via une API compatible OpenAI propulsée par des moteurs comme vLLM. Il est largement utilisé pour servir et orchestrer l'inférence à grande échelle sur des clusters.
Dépôt
ray-project/rayLangage
PythonCe que vous pourriez construire avec
- Servir et autoscaler des LLM sur un cluster via une API compatible OpenAI propulsée par vLLM
- Composer des pipelines d'inférence multi-modèles (récupération, classement, génération) sous forme de graphe de déploiement unique
- Exécuter de l'inférence en batch et du serving en ligne sur le même cluster Ray avec allocation fractionnée de GPU
Tags
servingdistributedscalinggpu