Tutto l'open source
Open SourceInferenza1k

Aphrodite Engine

Motore di inferenza LLM ad alto throughput per il serving su larga scala.

Aphrodite Engine è il backend di inferenza open-source sviluppato da PygmalionAI per servire LLM su larga scala. Basato sul core di vLLM con PagedAttention e continuous batching, aggiunge ampio supporto alla quantizzazione, numerosi metodi di sampling e speculative decoding, esponendo un'API compatibile con OpenAI. È progettato per massimizzare il throughput quando si servono molti utenti concorrenti da un singolo endpoint.

Repository

aphrodite-engine/aphrodite-engine

Linguaggio

Python

Cosa ci costruiresti

  • Serving di un LLM a molti utenti concorrenti con alto throughput e continuous batching
  • Esecuzione di modelli fortemente quantizzati con un'ampia selezione di formati di quantizzazione
  • Esposizione di sampling avanzato e speculative decoding dietro un'API compatibile con OpenAI

Tag

servingthroughputquantizationopenai-compatible