All åpen kildekode
Åpen kildekodeInferens14k

KTransformers

Kjør enorme MoE-modeller lokalt ved å offloade eksperter til CPU og GPU.

KTransformers er et åpen kildekode-rammeverk fra Tsinghuas KVCache.AI for optimalisert lokal LLM-inferens, med fokus på å kjøre svært store mixture-of-experts-modeller på beskjeden maskinvare. Det bruker heterogen CPU/GPU-offloading og kjerneoptimaliseringer for å serve modeller som DeepSeek-V3/R1 med kun én eller noen få forbrukergrafikkort pluss system-RAM, og eksponerer en OpenAI-kompatibel API og et chat-UI. Det ble kjent for å gjøre frontier-størrelses MoE-modeller kjørbare på én enkelt arbeidsstasjon.

Kodelager

kvcache-ai/ktransformers

Språk

Python

Det du kan bygge med den

  • Kjøring av store MoE-modeller (DeepSeek-V3/R1) lokalt med CPU+GPU-ekspertoffloading
  • Serving av frontier-størrelses modeller på én enkelt arbeidsstasjon med begrenset VRAM men rikelig RAM
  • Eksperimentering med inferensoptimaliseringer på kernenivå bak en OpenAI-kompatibel API

Tagger

servingmoeoffloadinglocal