Åpen kildekodeInferens14k
KTransformers
Kjør enorme MoE-modeller lokalt ved å offloade eksperter til CPU og GPU.
KTransformers er et åpen kildekode-rammeverk fra Tsinghuas KVCache.AI for optimalisert lokal LLM-inferens, med fokus på å kjøre svært store mixture-of-experts-modeller på beskjeden maskinvare. Det bruker heterogen CPU/GPU-offloading og kjerneoptimaliseringer for å serve modeller som DeepSeek-V3/R1 med kun én eller noen få forbrukergrafikkort pluss system-RAM, og eksponerer en OpenAI-kompatibel API og et chat-UI. Det ble kjent for å gjøre frontier-størrelses MoE-modeller kjørbare på én enkelt arbeidsstasjon.
Kodelager
kvcache-ai/ktransformersSpråk
PythonDet du kan bygge med den
- Kjøring av store MoE-modeller (DeepSeek-V3/R1) lokalt med CPU+GPU-ekspertoffloading
- Serving av frontier-størrelses modeller på én enkelt arbeidsstasjon med begrenset VRAM men rikelig RAM
- Eksperimentering med inferensoptimaliseringer på kernenivå bak en OpenAI-kompatibel API
Tagger
servingmoeoffloadinglocal