Åpen kildekodeInferens37k
Ray Serve / Ray
Distribuert rammeverk for skalering av modellserving og AI-arbeidslaster.
Ray er et åpen kildekode-rammeverk for skalering av Python- og AI-applikasjoner, og Ray Serve-biblioteket tilbyr et skalerbart, rammeverks-agnostisk lag for modellserving. Ray Serve støtter sammensetning av flere modeller i deployment-grafer, autoskalering, fraksjonell GPU-tildeling og batching, og inkluderer LLM-spesifikk serving med en OpenAI-kompatibel API støttet av motorer som vLLM. Det er mye brukt til å serve og orkestrere inferens i stor skala på tvers av klynger.
Kodelager
ray-project/raySpråk
PythonDet du kan bygge med den
- Serving og autoskalering av LLM-er på tvers av en klynge med en OpenAI-kompatibel API støttet av vLLM
- Sammensetning av flermodell-inferensrørledninger (henting, rangering, generering) som én enkelt deployment-graf
- Kjøring av batch-inferens og online serving på samme Ray-klynge med fraksjonell GPU-tildeling
Tagger
servingdistributedscalinggpu