Tüm açık kaynaklar
Açık KaynakÇıkarım11k

Text Generation Inference

Il toolkit di produzione di Hugging Face per servire e deployare LLM.

Text Generation Inference (TGI) è il toolkit di produzione di Hugging Face per il deployment e il serving di LLM. Offre inferenza ottimizzata con funzionalità come parallelismo tensoriale, continuous batching, token streaming e quantizzazione, e si integra strettamente con l'ecosistema di modelli di Hugging Face. Alimenta l'inferenza hosted di Hugging Face ed è deployabile via container per il self-hosting.

Depo

huggingface/text-generation-inference

Dil

Python

Bununla neler kurabilirsin

  • Self-hosting di modelli dell'Hugging Face Hub come endpoint di inferenza in produzione con streaming e batching
  • Deployare serving LLM ottimizzato con parallelismo tensoriale e quantizzazione su infrastruttura GPU
  • Avviare un'API di generazione testo scalabile per applicazioni che usano l'ecosistema HF

Etiketler

servinghuggingfaceproduction