Todo el código abierto
Código abiertoInferencia11k

Text Generation Inference

Kit de herramientas de producción de Hugging Face para servir y desplegar LLMs.

Text Generation Inference (TGI) es el kit de herramientas de producción de Hugging Face para desplegar y servir LLMs. Proporciona inferencia optimizada con características como paralelismo tensorial, batching continuo, streaming de tokens y cuantización, e integra estrechamente con el ecosistema de modelos de Hugging Face. Potencia la inferencia alojada de Hugging Face y puede desplegarse mediante contenedor para autoalojamiento.

Repositorio

huggingface/text-generation-inference

Lenguaje

Python

Lo que construirías con esto

  • Autoalojar modelos del Hugging Face Hub como endpoint de inferencia en producción con streaming y batching
  • Desplegar servicio LLM optimizado con paralelismo tensorial y cuantización en infraestructura GPU
  • Poner en marcha una API de generación de texto escalable para aplicaciones que usan el ecosistema HF

Etiquetas

servinghuggingfaceproduction