All öppen källkod
Öppen källkodInferens18k

SGLang

Snabbt serveringsramverk för LLM:er och visionspråkmodeller.

SGLang är ett snabbt serveringsramverk för stora språk- och visionspråkmodeller som kombinerar en optimerad körning med ett strukturerat genereringsspråk. Körningsmiljön har RadixAttention för automatisk återanvändning av delade prefix-KV-cachar, tillsammans med kontinuerlig batchning och effektiv strukturerad/begränsad avkodning. Det riktar sig mot högdataflödesservering av komplexa, flerkalls- och agentbaserade LLM-program.

Kodförråd

sgl-project/sglang

Språk

Python

Vad du kan bygga med det

  • Serva LLM:er och visionspråkmodeller med högt dataflöde där många förfrågningar delar gemensamma promptprefix
  • Implementera komplexa promptningsprogram (flerstegs, förgrenat, parallella anrop) med det strukturerade genereringens DSL
  • Köra begränsad eller strukturerad avkodning (t.ex. JSON-schemalett utdata) effektivt i stor skala

Taggar

servingthroughputvlm