Åpen kildekodeInferens18k
SGLang
Raskt servingrammeverk for LLM-er og visjon-språk-modeller.
SGLang er et raskt servingrammeverk for store språk- og visjon-språk-modeller som kombinerer en optimalisert kjøretid med et strukturert genereringsspråk. Kjøretiden har RadixAttention for automatisk gjenbruk av delte prefiks-KV-buffere, sammen med kontinuerlig batching og effektiv strukturert/begrenset dekoding. Det er rettet mot høy-gjennomstrømnings serving av komplekse, flerkalls- og agentiske LLM-programmer.
Kodelager
sgl-project/sglangSpråk
PythonDet du kan bygge med den
- Serve LLM-er og visjon-språk-modeller med høy gjennomstrømning der mange forespørsler deler felles promptprefikser
- Implementere komplekse promptingprogrammer (flertrinns, forgrening, parallelle kall) med det strukturerte genererings-DSL-et
- Kjøre begrenset eller strukturert dekoding (f.eks. JSON-schema-styrt output) effektivt i stor skala
Tagger
servingthroughputvlm