Open SourceInferenza14k
KTransformers
Esegui enormi modelli MoE in locale scaricando gli esperti su CPU e GPU.
KTransformers è un framework open-source di KVCache.AI (Tsinghua) per l'inferenza locale ottimizzata di LLM, focalizzato sull'esecuzione di modelli mixture-of-experts molto grandi su hardware modesto. Utilizza offloading eterogeneo CPU/GPU e ottimizzazioni a livello di kernel per servire modelli come DeepSeek-V3/R1 con una o poche GPU consumer più RAM di sistema, esponendo un'API compatibile con OpenAI e una chat UI. È diventato noto per rendere eseguibili modelli MoE di dimensioni frontier su una singola workstation.
Repository
kvcache-ai/ktransformersLinguaggio
PythonCosa ci costruiresti
- Esecuzione locale di grandi modelli MoE (DeepSeek-V3/R1) con offloading degli esperti su CPU+GPU
- Serving di modelli di dimensioni frontier su una singola workstation con VRAM limitata ma ampia RAM
- Sperimentazione con ottimizzazioni di inferenza a livello di kernel dietro un'API compatibile con OpenAI
Tag
servingmoeoffloadinglocal