Open SourceInferenza37k
Ray Serve / Ray
Framework distribuito per scalare il serving dei modelli e i workload AI.
Ray è un framework open-source per scalare applicazioni Python e AI; la sua libreria Ray Serve fornisce uno strato di serving dei modelli scalabile e indipendente dal framework. Ray Serve supporta la composizione di più modelli in grafi di deployment, l'autoscaling, l'allocazione frazionata della GPU e il batching, e include un serving specifico per LLM con un'API compatibile con OpenAI basata su engine come vLLM. È ampiamente utilizzato per servire e orchestrare l'inferenza su larga scala su cluster.
Repository
ray-project/rayLinguaggio
PythonCosa ci costruiresti
- Serving e autoscaling di LLM su un cluster con un'API compatibile con OpenAI basata su vLLM
- Composizione di pipeline di inferenza multi-modello (retrieval, ranking, generazione) come un singolo grafo di deployment
- Esecuzione di inferenza batch e serving online sullo stesso cluster Ray con allocazione frazionata della GPU
Tag
servingdistributedscalinggpu