Tout l'open source
Open SourceInférence14k

KTransformers

Exécutez de gigantesques modèles MoE en local en déportant les experts sur CPU et GPU.

KTransformers est un framework open source de KVCache.AI (Tsinghua) pour l'inférence LLM locale optimisée, axé sur l'exécution de très grands modèles mixture-of-experts sur du matériel modeste. Il utilise un déchargement hétérogène CPU/GPU et des optimisations noyau pour servir des modèles comme DeepSeek-V3/R1 avec seulement un ou quelques GPU grand public plus de la RAM système, en exposant une API compatible OpenAI et une interface de chat. Il s'est imposé comme la solution permettant d'exécuter des modèles MoE de taille frontier sur une seule station de travail.

Dépôt

kvcache-ai/ktransformers

Langage

Python

Ce que vous pourriez construire avec

  • Exécuter de grands modèles MoE (DeepSeek-V3/R1) en local avec déchargement expert CPU+GPU
  • Servir des modèles de taille frontier sur une seule station de travail avec une VRAM limitée mais beaucoup de RAM
  • Expérimenter des optimisations d'inférence au niveau noyau derrière une API compatible OpenAI

Tags

servingmoeoffloadinglocal