Código abiertoInferencia37k
Ray Serve / Ray
Distribuerat ramverk för att skala modelldriftsättning och AI-arbetsbelastningar.
Ray är ett open source-ramverk för att skala Python- och AI-applikationer, och dess Ray Serve-bibliotek tillhandahåller ett skalbart, ramverksagnostiskt lager för modelldriftsättning. Ray Serve stödjer sammansättning av flera modeller i driftsättningsgrafer, autoskalning, fraktionerad GPU-allokering och batchning, och inkluderar LLM-specifik serving med ett OpenAI-kompatibelt API backat av motorer som vLLM. Det används i stor utsträckning för att driftsätta och orkestrera inferens i stor skala över kluster.
Repositorio
ray-project/rayLenguaje
PythonLo que construirías con esto
- Driftsätta och autoskala LLMs över ett kluster med ett OpenAI-kompatibelt API backat av vLLM
- Komponera inferenspipelines med flera modeller (hämtning, rankning, generering) som en enda driftsättningsgraf
- Köra batchinferens och online-serving på samma Ray-kluster med fraktionerad GPU-allokering
Etiquetas
servingdistributedscalinggpu