All öppen källkod
Öppen källkodInferens11k

Text Generation Inference

Hugging Faces produktionsverktyg för servering och driftsättning av LLM:er.

Text Generation Inference (TGI) är Hugging Faces produktionsklassade verktyg för att driftsätta och serva LLM:er. Det erbjuder optimerad inferens med funktioner som tensorparallellism, kontinuerlig batchning, tokenströmning och kvantisering, och integreras tätt med Hugging Faces modellekosystem. Det driver Hugging Faces hostade inferens och kan driftsättas via container för självhosting.

Kodförråd

huggingface/text-generation-inference

Språk

Python

Vad du kan bygga med det

  • Självhosta Hugging Face Hub-modeller som ett produktionsinferens-endpoint med strömning och batchning
  • Driftsätta optimerad LLM-servering med tensorparallellism och kvantisering på GPU-infrastruktur
  • Sätta upp ett skalbart textgenerings-API för applikationer som använder HF-ekosystemet

Taggar

servinghuggingfaceproduction