Tüm açık kaynaklar
Açık KaynakÇıkarım11k

Text Generation Inference

Hugging Face'in LLM sunumu ve dağıtımı için üretim araç seti.

Text Generation Inference (TGI), LLM'leri dağıtmak ve sunmak için Hugging Face'in üretim kalitesinde araç setidir. Tensör paralelliği, sürekli toplu işlem, token akışı ve kuantizasyon gibi özelliklerle optimize edilmiş çıkarım sağlar; Hugging Face model ekosistemiyle sıkı sıkıya entegre olur. Hugging Face'in barındırılan çıkarımına güç verir ve kendi kendine barındırma için container aracılığıyla dağıtılabilir.

Depo

huggingface/text-generation-inference

Dil

Python

Bununla neler kurabilirsin

  • Hugging Face Hub modellerini akış ve toplu işlem desteğiyle üretim çıkarım endpoint'i olarak kendi sunucunuzda barındırma
  • GPU altyapısında tensör paralelliği ve kuantizasyonla optimize LLM sunumu dağıtma
  • HF ekosistemini kullanan uygulamalar için ölçeklenebilir bir metin üretim API'si kurma

Etiketler

servinghuggingfaceproduction