Open SourceInferenz11k
Text Generation Inference
Hugging Faces Produktions-Toolkit für Serving und Deployment von LLMs.
Text Generation Inference (TGI) ist Hugging Faces produktionsreifes Toolkit für das Deployment und Serving von LLMs. Es bietet optimierte Inferenz mit Funktionen wie Tensor-Parallelismus, Continuous Batching, Token-Streaming und Quantisierung und ist eng in das Hugging-Face-Modell-Ökosystem integriert. Es betreibt Hugging Faces gehostete Inferenz und kann per Container selbst gehostet werden.
Repository
huggingface/text-generation-inferenceSprache
PythonWas du damit bauen kannst
- Selbst hosten von Hugging-Face-Hub-Modellen als produktionsfähiger Inferenz-Endpunkt mit Streaming und Batching
- Deployment von optimiertem LLM-Serving mit Tensor-Parallelismus und Quantisierung auf GPU-Infrastruktur
- Aufsetzen einer skalierbaren Textgenerierungs-API für Anwendungen, die das HF-Ökosystem nutzen
Tags
servinghuggingfaceproduction