Open SourceInferenz18k
SGLang
Schnelles Serving-Framework für LLMs und Vision-Language-Modelle.
SGLang ist ein schnelles Serving-Framework für große Sprach- und Vision-Language-Modelle, das eine optimierte Laufzeitumgebung mit einer strukturierten Generierungssprache kombiniert. Die Laufzeitumgebung bietet RadixAttention für automatische Wiederverwendung gemeinsamer Präfix-KV-Caches sowie Continuous Batching und effizientes strukturiertes/eingeschränktes Decoding. Es zielt auf hochdurchsatz-fähiges Serving komplexer, mehrstufiger und agentischer LLM-Programme ab.
Repository
sgl-project/sglangSprache
PythonWas du damit bauen kannst
- Bereitstellen von LLMs und Vision-Language-Modellen mit hohem Durchsatz, wenn viele Anfragen gemeinsame Prompt-Präfixe teilen
- Implementieren komplexer Prompting-Programme (mehrstufig, verzweigt, parallele Aufrufe) mit der strukturierten Generierungs-DSL
- Effizientes Ausführen von eingeschränktem oder strukturiertem Decoding (z. B. JSON-Schema-gesteuerter Output) im großen Maßstab
Tags
servingthroughputvlm