Açık KaynakÇıkarım11k
Text Generation Inference
Il toolkit di produzione di Hugging Face per servire e deployare LLM.
Text Generation Inference (TGI) è il toolkit di produzione di Hugging Face per il deployment e il serving di LLM. Offre inferenza ottimizzata con funzionalità come parallelismo tensoriale, continuous batching, token streaming e quantizzazione, e si integra strettamente con l'ecosistema di modelli di Hugging Face. Alimenta l'inferenza hosted di Hugging Face ed è deployabile via container per il self-hosting.
Depo
huggingface/text-generation-inferenceDil
PythonBununla neler kurabilirsin
- Self-hosting di modelli dell'Hugging Face Hub come endpoint di inferenza in produzione con streaming e batching
- Deployare serving LLM ottimizzato con parallelismo tensoriale e quantizzazione su infrastruttura GPU
- Avviare un'API di generazione testo scalabile per applicazioni che usano l'ecosistema HF
Etiketler
servinghuggingfaceproduction