Tout l'open source
Open SourceInférence84k

vLLM

Moteur de service LLM à haut débit, construit autour de PagedAttention.

vLLM est un moteur d'inférence et de service pour LLM à haut débit et économe en mémoire, développé initialement à l'UC Berkeley. Son innovation principale, PagedAttention, gère le cache clé-valeur de l'attention à la manière de la mémoire virtuelle pour améliorer considérablement l'utilisation de la mémoire GPU et le débit de traitement par lot. Il prend en charge le batching continu, le parallélisme de tenseurs et de pipeline, la quantification et un serveur compatible OpenAI, et est largement utilisé pour le service à l'échelle de la production.

Dépôt

vllm-project/vllm

Langage

Python

Ce que vous pourriez construire avec

  • Servir des modèles open weight à haut débit et faible latence en production
  • Maximiser l'utilisation du GPU pour de nombreuses requêtes d'inférence concurrentes via le batching continu
  • Exécuter de grands modèles sur plusieurs GPU avec parallélisme de tenseurs et de pipeline, derrière une API compatible OpenAI

Tags

servingthroughputgpu