Open SourceInferentie11k
Text Generation Inference
De productietoolkit van Hugging Face voor het serveren en deployen van LLMs.
Text Generation Inference (TGI) is de productiekwaliteit toolkit van Hugging Face voor het deployen en serveren van LLMs. Het biedt geoptimaliseerde inferentie met functies als tensorparallelisme, continue batching, tokenstreaming en kwantisatie, en integreert nauw met het modelecosysteem van Hugging Face. Het drijft de gehoste inferentie van Hugging Face aan en is via container te deployen voor zelf-hosting.
Opslagplaats
huggingface/text-generation-inferenceTaal
PythonWat je ermee zou bouwen
- Hugging Face Hub-modellen zelf hosten als productie-inferentie-endpoint met streaming en batching
- Geoptimaliseerde LLM-serving deployen met tensorparallelisme en kwantisatie op GPU-infrastructuur
- Een schaalbare tekstgeneratie-API opzetten voor applicaties die het HF-ecosysteem gebruiken
Tags
servinghuggingfaceproduction