Öppen källkodInferens18k
SGLang
Snabbt serveringsramverk för LLM:er och visionspråkmodeller.
SGLang är ett snabbt serveringsramverk för stora språk- och visionspråkmodeller som kombinerar en optimerad körning med ett strukturerat genereringsspråk. Körningsmiljön har RadixAttention för automatisk återanvändning av delade prefix-KV-cachar, tillsammans med kontinuerlig batchning och effektiv strukturerad/begränsad avkodning. Det riktar sig mot högdataflödesservering av komplexa, flerkalls- och agentbaserade LLM-program.
Kodförråd
sgl-project/sglangSpråk
PythonVad du kan bygga med det
- Serva LLM:er och visionspråkmodeller med högt dataflöde där många förfrågningar delar gemensamma promptprefix
- Implementera komplexa promptningsprogram (flerstegs, förgrenat, parallella anrop) med det strukturerade genereringens DSL
- Köra begränsad eller strukturerad avkodning (t.ex. JSON-schemalett utdata) effektivt i stor skala
Taggar
servingthroughputvlm