All åpen kildekode
Åpen kildekodeInferens11k

Text Generation Inference

Hugging Face sitt produksjonsverktøy for serving og deployment av LLM-er.

Text Generation Inference (TGI) er Hugging Face sitt produksjonsklare verktøy for å deploye og serve LLM-er. Det tilbyr optimalisert inferens med funksjoner som tensor-parallellisme, kontinuerlig batching, token-streaming og kvantisering, og integreres tett med Hugging Face sitt modellØkosystem. Det driver Hugging Face sin hostede inferens og kan deployeres via container for selvhosting.

Kodelager

huggingface/text-generation-inference

Språk

Python

Det du kan bygge med den

  • Selvhoste Hugging Face Hub-modeller som et produksjonsinferensendepunkt med streaming og batching
  • Deploye optimalisert LLM-serving med tensor-parallellisme og kvantisering på GPU-infrastruktur
  • Sette opp et skalerbart tekstgenerings-API for applikasjoner som bruker HF-økosystemet

Tagger

servinghuggingfaceproduction