Alle Open Source
Open SourceInferenz14k

KTransformers

Große MoE-Modelle lokal betreiben durch Auslagerung von Experten auf CPU und GPU.

KTransformers ist ein Open-Source-Framework von KVCache.AI der Tsinghua-Universität für optimierte lokale LLM-Inferenz, das darauf ausgerichtet ist, sehr große Mixture-of-Experts-Modelle auf handelsüblicher Hardware auszuführen. Es nutzt heterogenes CPU/GPU-Offloading und Kernel-Optimierungen, um Modelle wie DeepSeek-V3/R1 mit nur einer oder wenigen Consumer-GPUs zuzüglich System-RAM zu bedienen; dabei werden eine OpenAI-kompatible API und eine Chat-UI bereitgestellt. Es wurde weithin bekannt dafür, MoE-Modelle in Frontier-Größe auf einer einzelnen Workstation lauffähig zu machen.

Repository

kvcache-ai/ktransformers

Sprache

Python

Was du damit bauen kannst

  • Große MoE-Modelle (DeepSeek-V3/R1) lokal mit CPU+GPU-Expert-Offloading betreiben
  • Frontier-große Modelle auf einer einzelnen Workstation mit begrenztem VRAM, aber ausreichend RAM bedienen
  • Mit Inferenz-Optimierungen auf Kernel-Ebene hinter einer OpenAI-kompatiblen API experimentieren

Tags

servingmoeoffloadinglocal