Open SourceInferenza1k
Aphrodite Engine
Motore di inferenza LLM ad alto throughput per il serving su larga scala.
Aphrodite Engine è il backend di inferenza open-source sviluppato da PygmalionAI per servire LLM su larga scala. Basato sul core di vLLM con PagedAttention e continuous batching, aggiunge ampio supporto alla quantizzazione, numerosi metodi di sampling e speculative decoding, esponendo un'API compatibile con OpenAI. È progettato per massimizzare il throughput quando si servono molti utenti concorrenti da un singolo endpoint.
Repository
aphrodite-engine/aphrodite-engineLinguaggio
PythonCosa ci costruiresti
- Serving di un LLM a molti utenti concorrenti con alto throughput e continuous batching
- Esecuzione di modelli fortemente quantizzati con un'ampia selezione di formati di quantizzazione
- Esposizione di sampling avanzato e speculative decoding dietro un'API compatibile con OpenAI
Tag
servingthroughputquantizationopenai-compatible