All åpen kildekode
Åpen kildekodeInferens37k

Ray Serve / Ray

Distribuert rammeverk for skalering av modellserving og AI-arbeidslaster.

Ray er et åpen kildekode-rammeverk for skalering av Python- og AI-applikasjoner, og Ray Serve-biblioteket tilbyr et skalerbart, rammeverks-agnostisk lag for modellserving. Ray Serve støtter sammensetning av flere modeller i deployment-grafer, autoskalering, fraksjonell GPU-tildeling og batching, og inkluderer LLM-spesifikk serving med en OpenAI-kompatibel API støttet av motorer som vLLM. Det er mye brukt til å serve og orkestrere inferens i stor skala på tvers av klynger.

Kodelager

ray-project/ray

Språk

Python

Det du kan bygge med den

  • Serving og autoskalering av LLM-er på tvers av en klynge med en OpenAI-kompatibel API støttet av vLLM
  • Sammensetning av flermodell-inferensrørledninger (henting, rangering, generering) som én enkelt deployment-graf
  • Kjøring av batch-inferens og online serving på samme Ray-klynge med fraksjonell GPU-tildeling

Tagger

servingdistributedscalinggpu