Tout l'open source
Open SourceInférence1k

Aphrodite Engine

Moteur d'inférence LLM à haut débit pour un serving à grande échelle.

Aphrodite Engine est le backend d'inférence open source développé par PygmalionAI pour servir des LLM à grande échelle. Construit sur le cœur de vLLM avec PagedAttention et continuous batching, il ajoute un large support de quantification, de nombreuses méthodes d'échantillonnage et du speculative decoding, en exposant une API compatible OpenAI. Il est conçu pour maximiser le débit lors du serving à de nombreux utilisateurs simultanés depuis un seul endpoint.

Dépôt

aphrodite-engine/aphrodite-engine

Langage

Python

Ce que vous pourriez construire avec

  • Servir un LLM à de nombreux utilisateurs simultanés avec un débit élevé et du continuous batching
  • Exécuter des modèles fortement quantifiés avec un large choix de formats de quantification
  • Exposer un échantillonnage riche et du speculative decoding derrière une API compatible OpenAI

Tags

servingthroughputquantizationopenai-compatible