Open SourceInferenza18k
SGLang
Framework di serving veloce per LLM e modelli vision-language.
SGLang è un framework di serving veloce per modelli linguistici e vision-language di grandi dimensioni, che combina un runtime ottimizzato con un linguaggio di generazione strutturata. Il suo runtime include RadixAttention per il riutilizzo automatico delle cache KV di prefissi condivisi, continuous batching e decodifica strutturata/vincolata efficiente. Punta a un serving ad alto throughput di programmi LLM complessi, multi-chiamata e agentivi.
Repository
sgl-project/sglangLinguaggio
PythonCosa ci costruiresti
- Servire LLM e modelli vision-language con alto throughput quando molte richieste condividono prefissi di prompt comuni
- Implementare programmi di prompting complessi (multi-turn, ramificati, chiamate parallele) con il DSL di generazione strutturata
- Eseguire decodifica vincolata o strutturata (es. output guidato da JSON schema) in modo efficiente su larga scala
Tag
servingthroughputvlm