Öppen källkodInferens11k
Text Generation Inference
Hugging Faces produktionsverktyg för servering och driftsättning av LLM:er.
Text Generation Inference (TGI) är Hugging Faces produktionsklassade verktyg för att driftsätta och serva LLM:er. Det erbjuder optimerad inferens med funktioner som tensorparallellism, kontinuerlig batchning, tokenströmning och kvantisering, och integreras tätt med Hugging Faces modellekosystem. Det driver Hugging Faces hostade inferens och kan driftsättas via container för självhosting.
Kodförråd
huggingface/text-generation-inferenceSpråk
PythonVad du kan bygga med det
- Självhosta Hugging Face Hub-modeller som ett produktionsinferens-endpoint med strömning och batchning
- Driftsätta optimerad LLM-servering med tensorparallellism och kvantisering på GPU-infrastruktur
- Sätta upp ett skalbart textgenerings-API för applikationer som använder HF-ekosystemet
Taggar
servinghuggingfaceproduction