All öppen källkod
Öppen källkodInferens14k

KTransformers

Kör enorma MoE-modeller lokalt genom att avlasta experter till CPU och GPU.

KTransformers är ett open source-ramverk från Tsinghua:s KVCache.AI för optimerad lokal LLM-inferens, med fokus på att köra mycket stora mixture-of-experts-modeller på blygsam hårdvara. Det använder heterogen CPU/GPU-avlastning och kerneloptimiseringar för att driftsätta modeller som DeepSeek-V3/R1 med bara en eller ett fåtal konsument-GPU:er plus systemminne, och exponerar ett OpenAI-kompatibelt API och ett chatt-UI. Det blev välkänt för att göra MoE-modeller av frontierstorlek körbara på en enda arbetsstation.

Kodförråd

kvcache-ai/ktransformers

Språk

Python

Vad du kan bygga med det

  • Köra stora MoE-modeller (DeepSeek-V3/R1) lokalt med CPU+GPU-expertavlastning
  • Driftsätta modeller av frontierstorlek på en enda arbetsstation med begränsat VRAM men gott om RAM
  • Experimentera med inferensoptimiseringar på kernelnivå bakom ett OpenAI-kompatibelt API

Taggar

servingmoeoffloadinglocal