Open SourceInferenz1k
Aphrodite Engine
Hochdurchsatz-LLM-Inferenz-Engine für großskaliges Serving.
Aphrodite Engine ist das von PygmalionAI entwickelte Open-Source-Inferenz-Backend für das Serving von LLMs im großen Maßstab. Auf dem vLLM-Kern mit PagedAttention und Continuous Batching aufgebaut, ergänzt es umfassende Quantisierungsunterstützung, viele Sampling-Methoden und Speculative Decoding und stellt eine OpenAI-kompatible API bereit. Es ist darauf ausgelegt, den Durchsatz beim Serving vieler gleichzeitiger Nutzer von einem einzelnen Endpunkt zu maximieren.
Repository
aphrodite-engine/aphrodite-engineSprache
PythonWas du damit bauen kannst
- Einen LLM für viele gleichzeitige Nutzer mit hohem Durchsatz und Continuous Batching bereitstellen
- Stark quantisierte Modelle mit einer breiten Auswahl an Quantisierungsformaten betreiben
- Reichhaltige Sampling-Optionen und Speculative Decoding hinter einer OpenAI-kompatiblen API anbieten
Tags
servingthroughputquantizationopenai-compatible