Open SourceInferentie37k
Ray Serve / Ray
Gedistribueerd framework voor het schalen van modelserving en AI-workloads.
Ray is een open-source framework voor het schalen van Python- en AI-applicaties. De Ray Serve-bibliotheek biedt een schaalbare, framework-agnostische modelserving-laag. Ray Serve ondersteunt het samenstellen van meerdere modellen tot deployment-graphs, autoscaling, fractionele GPU-toewijzing en batching, en bevat LLM-specifieke serving met een OpenAI-compatibele API ondersteund door engines zoals vLLM. Het wordt breed ingezet voor het serveren en orkestreren van inferentie op schaal over clusters.
Opslagplaats
ray-project/rayTaal
PythonWat je ermee zou bouwen
- Serveren en autoscalen van LLM's over een cluster met een OpenAI-compatibele API ondersteund door vLLM
- Samenstellen van multi-model inferentiepipelines (retrieval, ranking, generatie) als één deployment-graph
- Uitvoeren van batch-inferentie en online serving op hetzelfde Ray-cluster met fractionele GPU-toewijzing
Tags
servingdistributedscalinggpu