Open SourceInférence1k
Aphrodite Engine
Moteur d'inférence LLM à haut débit pour un serving à grande échelle.
Aphrodite Engine est le backend d'inférence open source développé par PygmalionAI pour servir des LLM à grande échelle. Construit sur le cœur de vLLM avec PagedAttention et continuous batching, il ajoute un large support de quantification, de nombreuses méthodes d'échantillonnage et du speculative decoding, en exposant une API compatible OpenAI. Il est conçu pour maximiser le débit lors du serving à de nombreux utilisateurs simultanés depuis un seul endpoint.
Dépôt
aphrodite-engine/aphrodite-engineLangage
PythonCe que vous pourriez construire avec
- Servir un LLM à de nombreux utilisateurs simultanés avec un débit élevé et du continuous batching
- Exécuter des modèles fortement quantifiés avec un large choix de formats de quantification
- Exposer un échantillonnage riche et du speculative decoding derrière une API compatible OpenAI
Tags
servingthroughputquantizationopenai-compatible