Open SourceInférence18k
SGLang
Framework de service rapide pour les LLM et les modèles vision-langage.
SGLang est un framework de service rapide pour les grands modèles de langage et vision-langage, combinant un moteur d'exécution optimisé avec un langage de génération structurée. Son moteur propose RadixAttention pour la réutilisation automatique des caches KV de préfixes partagés, ainsi que le batching continu et un décodage structuré/contraint efficace. Il cible le service à haut débit de programmes LLM complexes, multi-appels et agentiques.
Dépôt
sgl-project/sglangLangage
PythonCe que vous pourriez construire avec
- Servir des LLM et des modèles vision-langage à haut débit lorsque de nombreuses requêtes partagent des préfixes de prompt communs
- Implémenter des programmes de prompting complexes (multi-tours, ramification, appels parallèles) avec le DSL de génération structurée
- Exécuter efficacement à grande échelle un décodage contraint ou structuré (par exemple, sortie guidée par un schéma JSON)
Tags
servingthroughputvlm