Open SourceInferenz11k
OpenLLM
Jeden offenen LLM als OpenAI-kompatiblen API-Endpunkt betreiben, überall.
OpenLLM vom BentoML-Team ermöglicht es, Open-Source- und fein abgestimmte LLMs mit einem einzigen Befehl als OpenAI-kompatible API-Endpunkte zu betreiben. Es unterstützt gängige Modelle direkt, optimierte Inferenz-Backends wie vLLM, eine eingebaute Chat-UI und Einzel-Klick-Deployment zu Docker, Kubernetes oder BentoCloud. Es ist darauf ausgelegt, das selbst gehostete Betreiben von Produktions-LLM-APIs einfach und portabel zu gestalten.
Repository
bentoml/OpenLLMSprache
PythonWas du damit bauen kannst
- Einen OpenAI-kompatiblen Endpunkt für jedes unterstützte offene Modell mit einem Befehl hochfahren
- Einen LLM-Service als Bento für reproduzierbares Docker-/Kubernetes-Deployment verpacken
- Fein abgestimmte Modelle mit vLLM-gestützter Inferenz und einer eingebauten Chat-UI bereitstellen
Tags
servingopenai-compatibledeploymentself-hosted