Código abiertoInferencia84k
vLLM
Motor de servicio LLM de alto rendimiento basado en PagedAttention.
vLLM es un motor de inferencia y servicio para LLMs de alto rendimiento y uso eficiente de memoria, originario de UC Berkeley. Su innovación central, PagedAttention, gestiona la caché de valores clave de atención como memoria virtual para mejorar significativamente el aprovechamiento de la memoria GPU y el rendimiento del batching. Admite batching continuo, paralelismo tensorial y de pipeline, cuantización y un servidor compatible con OpenAI, y es ampliamente utilizado para servicio a escala de producción.
Repositorio
vllm-project/vllmLenguaje
PythonLo que construirías con esto
- Servir modelos de pesos abiertos con alta throughput y baja latencia en producción
- Maximizar el aprovechamiento de la GPU para muchas peticiones de inferencia concurrentes mediante batching continuo
- Ejecutar modelos grandes en múltiples GPUs con paralelismo tensorial y de pipeline detrás de una API compatible con OpenAI
Etiquetas
servingthroughputgpu