Alle Open Source
Open SourceInferenz18k

SGLang

Snel servingframework voor LLMs en vision-language modellen.

SGLang is een snel servingframework voor grote taal- en vision-language modellen dat een geoptimaliseerde runtime combineert met een gestructureerde generatietaal. De runtime beschikt over RadixAttention voor het automatisch hergebruiken van gedeelde prefix-KV-caches, continue batching en efficiënte gestructureerde/beperkte decodering. Het is gericht op high-throughput serving van complexe, multi-aanroep en agentische LLM-programma's.

Repository

sgl-project/sglang

Sprache

Python

Was du damit bauen kannst

  • LLMs en vision-language modellen serveren met hoge throughput waarbij veel verzoeken gemeenschappelijke promptprefixes delen
  • Complexe promptprogramma's implementeren (multi-turn, vertakkend, parallelle aanroepen) met de gestructureerde generatie-DSL
  • Beperkte of gestructureerde decodering (bijv. JSON-schema-geleide uitvoer) efficiënt op schaal uitvoeren

Tags

servingthroughputvlm