Öppen källkodInferens14k
KTransformers
Kör enorma MoE-modeller lokalt genom att avlasta experter till CPU och GPU.
KTransformers är ett open source-ramverk från Tsinghua:s KVCache.AI för optimerad lokal LLM-inferens, med fokus på att köra mycket stora mixture-of-experts-modeller på blygsam hårdvara. Det använder heterogen CPU/GPU-avlastning och kerneloptimiseringar för att driftsätta modeller som DeepSeek-V3/R1 med bara en eller ett fåtal konsument-GPU:er plus systemminne, och exponerar ett OpenAI-kompatibelt API och ett chatt-UI. Det blev välkänt för att göra MoE-modeller av frontierstorlek körbara på en enda arbetsstation.
Kodförråd
kvcache-ai/ktransformersSpråk
PythonVad du kan bygga med det
- Köra stora MoE-modeller (DeepSeek-V3/R1) lokalt med CPU+GPU-expertavlastning
- Driftsätta modeller av frontierstorlek på en enda arbetsstation med begränsat VRAM men gott om RAM
- Experimentera med inferensoptimiseringar på kernelnivå bakom ett OpenAI-kompatibelt API
Taggar
servingmoeoffloadinglocal