Código abiertoInferencia14k
KTransformers
Ejecuta enormes modelos MoE localmente transfiriendo expertos a CPU y GPU.
KTransformers es un framework de código abierto de KVCache.AI (Tsinghua) para inferencia local optimizada de LLMs, centrado en ejecutar modelos de mezcla de expertos muy grandes en hardware modesto. Utiliza transferencia heterogénea CPU/GPU y optimizaciones de kernel para servir modelos como DeepSeek-V3/R1 con solo una o pocas GPU de consumo más RAM del sistema, exponiendo una API compatible con OpenAI y una UI de chat. Se hizo conocido por hacer posible ejecutar modelos MoE de escala frontera en una sola estación de trabajo.
Repositorio
kvcache-ai/ktransformersLenguaje
PythonLo que construirías con esto
- Ejecutar modelos MoE grandes (DeepSeek-V3/R1) localmente con transferencia de expertos CPU+GPU
- Servir modelos de escala frontera en una sola estación de trabajo con VRAM limitada pero RAM abundante
- Experimentar con optimizaciones de inferencia a nivel de kernel detrás de una API compatible con OpenAI
Etiquetas
servingmoeoffloadinglocal