Open SourceInférence14k
KTransformers
Exécutez de gigantesques modèles MoE en local en déportant les experts sur CPU et GPU.
KTransformers est un framework open source de KVCache.AI (Tsinghua) pour l'inférence LLM locale optimisée, axé sur l'exécution de très grands modèles mixture-of-experts sur du matériel modeste. Il utilise un déchargement hétérogène CPU/GPU et des optimisations noyau pour servir des modèles comme DeepSeek-V3/R1 avec seulement un ou quelques GPU grand public plus de la RAM système, en exposant une API compatible OpenAI et une interface de chat. Il s'est imposé comme la solution permettant d'exécuter des modèles MoE de taille frontier sur une seule station de travail.
Dépôt
kvcache-ai/ktransformersLangage
PythonCe que vous pourriez construire avec
- Exécuter de grands modèles MoE (DeepSeek-V3/R1) en local avec déchargement expert CPU+GPU
- Servir des modèles de taille frontier sur une seule station de travail avec une VRAM limitée mais beaucoup de RAM
- Expérimenter des optimisations d'inférence au niveau noyau derrière une API compatible OpenAI
Tags
servingmoeoffloadinglocal