Açık KaynakÇıkarım11k
Text Generation Inference
Hugging Face'in LLM sunumu ve dağıtımı için üretim araç seti.
Text Generation Inference (TGI), LLM'leri dağıtmak ve sunmak için Hugging Face'in üretim kalitesinde araç setidir. Tensör paralelliği, sürekli toplu işlem, token akışı ve kuantizasyon gibi özelliklerle optimize edilmiş çıkarım sağlar; Hugging Face model ekosistemiyle sıkı sıkıya entegre olur. Hugging Face'in barındırılan çıkarımına güç verir ve kendi kendine barındırma için container aracılığıyla dağıtılabilir.
Depo
huggingface/text-generation-inferenceDil
PythonBununla neler kurabilirsin
- Hugging Face Hub modellerini akış ve toplu işlem desteğiyle üretim çıkarım endpoint'i olarak kendi sunucunuzda barındırma
- GPU altyapısında tensör paralelliği ve kuantizasyonla optimize LLM sunumu dağıtma
- HF ekosistemini kullanan uygulamalar için ölçeklenebilir bir metin üretim API'si kurma
Etiketler
servinghuggingfaceproduction