Alle open source
Open SourceInferentie37k

Ray Serve / Ray

Gedistribueerd framework voor het schalen van modelserving en AI-workloads.

Ray is een open-source framework voor het schalen van Python- en AI-applicaties. De Ray Serve-bibliotheek biedt een schaalbare, framework-agnostische modelserving-laag. Ray Serve ondersteunt het samenstellen van meerdere modellen tot deployment-graphs, autoscaling, fractionele GPU-toewijzing en batching, en bevat LLM-specifieke serving met een OpenAI-compatibele API ondersteund door engines zoals vLLM. Het wordt breed ingezet voor het serveren en orkestreren van inferentie op schaal over clusters.

Opslagplaats

ray-project/ray

Taal

Python

Wat je ermee zou bouwen

  • Serveren en autoscalen van LLM's over een cluster met een OpenAI-compatibele API ondersteund door vLLM
  • Samenstellen van multi-model inferentiepipelines (retrieval, ranking, generatie) als één deployment-graph
  • Uitvoeren van batch-inferentie en online serving op hetzelfde Ray-cluster met fractionele GPU-toewijzing

Tags

servingdistributedscalinggpu