Open SourceInferentie14k
KTransformers
Draai enorme MoE-modellen lokaal door experts te offloaden naar CPU en GPU.
KTransformers is een open-source framework van Tsinghua's KVCache.AI voor geoptimaliseerde lokale LLM-inferentie, gericht op het draaien van zeer grote mixture-of-experts-modellen op bescheiden hardware. Het gebruikt heterogene CPU/GPU-offloading en kernel-optimalisaties om modellen zoals DeepSeek-V3/R1 te serveren met slechts één of enkele consumer-GPU's plus systeem-RAM, met een OpenAI-compatibele API en een chat-UI. Het werd bekend door het mogelijk maken van frontier-size MoE-modellen op één workstation.
Opslagplaats
kvcache-ai/ktransformersTaal
PythonWat je ermee zou bouwen
- Lokaal draaien van grote MoE-modellen (DeepSeek-V3/R1) met CPU+GPU expert-offloading
- Serveren van frontier-size modellen op één workstation met beperkt VRAM maar ruim RAM
- Experimenteren met kernel-niveau inferentie-optimalisaties achter een OpenAI-compatibele API
Tags
servingmoeoffloadinglocal