Alle Open Source
Open SourceInferenz37k

Ray Serve / Ray

Verteiltes Framework zur Skalierung von Model-Serving und KI-Workloads.

Ray ist ein Open-Source-Framework zur Skalierung von Python- und KI-Anwendungen. Die Bibliothek Ray Serve bietet eine skalierbare, framework-agnostische Schicht für das Model-Serving. Ray Serve unterstützt das Komposieren mehrerer Modelle zu Deployment-Graphen, Autoscaling, fraktionale GPU-Zuweisung und Batching; hinzu kommt LLM-spezifisches Serving mit einer OpenAI-kompatiblen API, die von Engines wie vLLM gestützt wird. Es wird häufig genutzt, um Inferenz im Clustermaßstab zu bedienen und zu orchestrieren.

Repository

ray-project/ray

Sprache

Python

Was du damit bauen kannst

  • Serving und Autoscaling von LLMs im Cluster mit einer von vLLM gestützten OpenAI-kompatiblen API
  • Komposition von Multi-Modell-Inferenz-Pipelines (Retrieval, Ranking, Generierung) als einzelner Deployment-Graph
  • Betrieb von Batch-Inferenz und Online-Serving auf demselben Ray-Cluster mit fraktionaler GPU-Zuweisung

Tags

servingdistributedscalinggpu