Tutto l'open source
Open SourceInferenza37k

Ray Serve / Ray

Framework distribuito per scalare il serving dei modelli e i workload AI.

Ray è un framework open-source per scalare applicazioni Python e AI; la sua libreria Ray Serve fornisce uno strato di serving dei modelli scalabile e indipendente dal framework. Ray Serve supporta la composizione di più modelli in grafi di deployment, l'autoscaling, l'allocazione frazionata della GPU e il batching, e include un serving specifico per LLM con un'API compatibile con OpenAI basata su engine come vLLM. È ampiamente utilizzato per servire e orchestrare l'inferenza su larga scala su cluster.

Repository

ray-project/ray

Linguaggio

Python

Cosa ci costruiresti

  • Serving e autoscaling di LLM su un cluster con un'API compatibile con OpenAI basata su vLLM
  • Composizione di pipeline di inferenza multi-modello (retrieval, ranking, generazione) come un singolo grafo di deployment
  • Esecuzione di inferenza batch e serving online sullo stesso cluster Ray con allocazione frazionata della GPU

Tag

servingdistributedscalinggpu