Åpen kildekodeInferens11k
Text Generation Inference
Hugging Face sitt produksjonsverktøy for serving og deployment av LLM-er.
Text Generation Inference (TGI) er Hugging Face sitt produksjonsklare verktøy for å deploye og serve LLM-er. Det tilbyr optimalisert inferens med funksjoner som tensor-parallellisme, kontinuerlig batching, token-streaming og kvantisering, og integreres tett med Hugging Face sitt modellØkosystem. Det driver Hugging Face sin hostede inferens og kan deployeres via container for selvhosting.
Kodelager
huggingface/text-generation-inferenceSpråk
PythonDet du kan bygge med den
- Selvhoste Hugging Face Hub-modeller som et produksjonsinferensendepunkt med streaming og batching
- Deploye optimalisert LLM-serving med tensor-parallellisme og kvantisering på GPU-infrastruktur
- Sette opp et skalerbart tekstgenerings-API for applikasjoner som bruker HF-økosystemet
Tagger
servinghuggingfaceproduction