Todo el código abierto
Código abiertoInferencia14k

KTransformers

Ejecuta enormes modelos MoE localmente transfiriendo expertos a CPU y GPU.

KTransformers es un framework de código abierto de KVCache.AI (Tsinghua) para inferencia local optimizada de LLMs, centrado en ejecutar modelos de mezcla de expertos muy grandes en hardware modesto. Utiliza transferencia heterogénea CPU/GPU y optimizaciones de kernel para servir modelos como DeepSeek-V3/R1 con solo una o pocas GPU de consumo más RAM del sistema, exponiendo una API compatible con OpenAI y una UI de chat. Se hizo conocido por hacer posible ejecutar modelos MoE de escala frontera en una sola estación de trabajo.

Repositorio

kvcache-ai/ktransformers

Lenguaje

Python

Lo que construirías con esto

  • Ejecutar modelos MoE grandes (DeepSeek-V3/R1) localmente con transferencia de expertos CPU+GPU
  • Servir modelos de escala frontera en una sola estación de trabajo con VRAM limitada pero RAM abundante
  • Experimentar con optimizaciones de inferencia a nivel de kernel detrás de una API compatible con OpenAI

Etiquetas

servingmoeoffloadinglocal