Alle open source
Open SourceInferentie11k

Text Generation Inference

De productietoolkit van Hugging Face voor het serveren en deployen van LLMs.

Text Generation Inference (TGI) is de productiekwaliteit toolkit van Hugging Face voor het deployen en serveren van LLMs. Het biedt geoptimaliseerde inferentie met functies als tensorparallelisme, continue batching, tokenstreaming en kwantisatie, en integreert nauw met het modelecosysteem van Hugging Face. Het drijft de gehoste inferentie van Hugging Face aan en is via container te deployen voor zelf-hosting.

Opslagplaats

huggingface/text-generation-inference

Taal

Python

Wat je ermee zou bouwen

  • Hugging Face Hub-modellen zelf hosten als productie-inferentie-endpoint met streaming en batching
  • Geoptimaliseerde LLM-serving deployen met tensorparallelisme en kwantisatie op GPU-infrastructuur
  • Een schaalbare tekstgeneratie-API opzetten voor applicaties die het HF-ecosysteem gebruiken

Tags

servinghuggingfaceproduction