Alle Open Source
Open SourceInferenz11k

Text Generation Inference

Hugging Faces Produktions-Toolkit für Serving und Deployment von LLMs.

Text Generation Inference (TGI) ist Hugging Faces produktionsreifes Toolkit für das Deployment und Serving von LLMs. Es bietet optimierte Inferenz mit Funktionen wie Tensor-Parallelismus, Continuous Batching, Token-Streaming und Quantisierung und ist eng in das Hugging-Face-Modell-Ökosystem integriert. Es betreibt Hugging Faces gehostete Inferenz und kann per Container selbst gehostet werden.

Repository

huggingface/text-generation-inference

Sprache

Python

Was du damit bauen kannst

  • Selbst hosten von Hugging-Face-Hub-Modellen als produktionsfähiger Inferenz-Endpunkt mit Streaming und Batching
  • Deployment von optimiertem LLM-Serving mit Tensor-Parallelismus und Quantisierung auf GPU-Infrastruktur
  • Aufsetzen einer skalierbaren Textgenerierungs-API für Anwendungen, die das HF-Ökosystem nutzen

Tags

servinghuggingfaceproduction