Öppen källkodInferens1k
Aphrodite Engine
Höggenomströmnings-LLM-inferensmotor för storskalig serving.
Aphrodite Engine är den open source-inferensbakgrund som utvecklats av PygmalionAI för storskalig LLM-serving. Byggt på vLLM-kärnan med PagedAttention och kontinuerlig batchning tillägger den brett stöd för kvantiering, många samplingmetoder och spekulativ avkodning, och exponerar ett OpenAI-kompatibelt API. Det är utformat för att maximera genomströmning vid serving av många samtidiga användare från en enda endpoint.
Kodförråd
aphrodite-engine/aphrodite-engineSpråk
PythonVad du kan bygga med det
- Driftsätta en LLM till många samtidiga användare med hög genomströmning och kontinuerlig batchning
- Köra kraftigt kvanterade modeller med ett brett urval av kvantieringsformat
- Exponera rik sampling och spekulativ avkodning bakom ett OpenAI-kompatibelt API
Taggar
servingthroughputquantizationopenai-compatible