Código abiertoInferencia11k
Text Generation Inference
Kit de herramientas de producción de Hugging Face para servir y desplegar LLMs.
Text Generation Inference (TGI) es el kit de herramientas de producción de Hugging Face para desplegar y servir LLMs. Proporciona inferencia optimizada con características como paralelismo tensorial, batching continuo, streaming de tokens y cuantización, e integra estrechamente con el ecosistema de modelos de Hugging Face. Potencia la inferencia alojada de Hugging Face y puede desplegarse mediante contenedor para autoalojamiento.
Repositorio
huggingface/text-generation-inferenceLenguaje
PythonLo que construirías con esto
- Autoalojar modelos del Hugging Face Hub como endpoint de inferencia en producción con streaming y batching
- Desplegar servicio LLM optimizado con paralelismo tensorial y cuantización en infraestructura GPU
- Poner en marcha una API de generación de texto escalable para aplicaciones que usan el ecosistema HF
Etiquetas
servinghuggingfaceproduction