Open SourceInferenz18k
SGLang
Snel servingframework voor LLMs en vision-language modellen.
SGLang is een snel servingframework voor grote taal- en vision-language modellen dat een geoptimaliseerde runtime combineert met een gestructureerde generatietaal. De runtime beschikt over RadixAttention voor het automatisch hergebruiken van gedeelde prefix-KV-caches, continue batching en efficiënte gestructureerde/beperkte decodering. Het is gericht op high-throughput serving van complexe, multi-aanroep en agentische LLM-programma's.
Repository
sgl-project/sglangSprache
PythonWas du damit bauen kannst
- LLMs en vision-language modellen serveren met hoge throughput waarbij veel verzoeken gemeenschappelijke promptprefixes delen
- Complexe promptprogramma's implementeren (multi-turn, vertakkend, parallelle aanroepen) met de gestructureerde generatie-DSL
- Beperkte of gestructureerde decodering (bijv. JSON-schema-geleide uitvoer) efficiënt op schaal uitvoeren
Tags
servingthroughputvlm