Tutto l'open source
Open SourceInferenza18k

SGLang

Framework di serving veloce per LLM e modelli vision-language.

SGLang è un framework di serving veloce per modelli linguistici e vision-language di grandi dimensioni, che combina un runtime ottimizzato con un linguaggio di generazione strutturata. Il suo runtime include RadixAttention per il riutilizzo automatico delle cache KV di prefissi condivisi, continuous batching e decodifica strutturata/vincolata efficiente. Punta a un serving ad alto throughput di programmi LLM complessi, multi-chiamata e agentivi.

Repository

sgl-project/sglang

Linguaggio

Python

Cosa ci costruiresti

  • Servire LLM e modelli vision-language con alto throughput quando molte richieste condividono prefissi di prompt comuni
  • Implementare programmi di prompting complessi (multi-turn, ramificati, chiamate parallele) con il DSL di generazione strutturata
  • Eseguire decodifica vincolata o strutturata (es. output guidato da JSON schema) in modo efficiente su larga scala

Tag

servingthroughputvlm