Open SourceInferenza11k
Text Generation Inference
Il toolkit di produzione di Hugging Face per servire e deployare LLM.
Text Generation Inference (TGI) è il toolkit di produzione di Hugging Face per il deployment e il serving di LLM. Offre inferenza ottimizzata con funzionalità come parallelismo tensoriale, continuous batching, token streaming e quantizzazione, e si integra strettamente con l'ecosistema di modelli di Hugging Face. Alimenta l'inferenza hosted di Hugging Face ed è deployabile via container per il self-hosting.
Repository
huggingface/text-generation-inferenceLinguaggio
PythonCosa ci costruiresti
- Self-hosting di modelli dell'Hugging Face Hub come endpoint di inferenza in produzione con streaming e batching
- Deployare serving LLM ottimizzato con parallelismo tensoriale e quantizzazione su infrastruttura GPU
- Avviare un'API di generazione testo scalabile per applicazioni che usano l'ecosistema HF
Tag
servinghuggingfaceproduction