Todo el código abierto
Código abiertoInferencia37k

Ray Serve / Ray

Distribuerat ramverk för att skala modelldriftsättning och AI-arbetsbelastningar.

Ray är ett open source-ramverk för att skala Python- och AI-applikationer, och dess Ray Serve-bibliotek tillhandahåller ett skalbart, ramverksagnostiskt lager för modelldriftsättning. Ray Serve stödjer sammansättning av flera modeller i driftsättningsgrafer, autoskalning, fraktionerad GPU-allokering och batchning, och inkluderar LLM-specifik serving med ett OpenAI-kompatibelt API backat av motorer som vLLM. Det används i stor utsträckning för att driftsätta och orkestrera inferens i stor skala över kluster.

Repositorio

ray-project/ray

Lenguaje

Python

Lo que construirías con esto

  • Driftsätta och autoskala LLMs över ett kluster med ett OpenAI-kompatibelt API backat av vLLM
  • Komponera inferenspipelines med flera modeller (hämtning, rankning, generering) som en enda driftsättningsgraf
  • Köra batchinferens och online-serving på samma Ray-kluster med fraktionerad GPU-allokering

Etiquetas

servingdistributedscalinggpu