Open SourceInférence11k
Text Generation Inference
La boîte à outils de production de Hugging Face pour servir et déployer des LLM.
Text Generation Inference (TGI) est la boîte à outils de niveau production de Hugging Face pour déployer et servir des LLM. Elle offre une inférence optimisée avec des fonctionnalités telles que le parallélisme de tenseurs, le batching continu, le streaming de tokens et la quantification, et s'intègre étroitement avec l'écosystème de modèles Hugging Face. Elle alimente l'inférence hébergée de Hugging Face et peut être déployée via conteneur pour l'auto-hébergement.
Dépôt
huggingface/text-generation-inferenceLangage
PythonCe que vous pourriez construire avec
- Auto-héberger des modèles du Hugging Face Hub sous forme d'endpoint d'inférence en production avec streaming et batching
- Déployer un service LLM optimisé avec parallélisme de tenseurs et quantification sur une infrastructure GPU
- Mettre en place une API de génération de texte évolutive pour des applications utilisant l'écosystème HF
Tags
servinghuggingfaceproduction