Tutto l'open source
Open SourceInferenza14k

KTransformers

Esegui enormi modelli MoE in locale scaricando gli esperti su CPU e GPU.

KTransformers è un framework open-source di KVCache.AI (Tsinghua) per l'inferenza locale ottimizzata di LLM, focalizzato sull'esecuzione di modelli mixture-of-experts molto grandi su hardware modesto. Utilizza offloading eterogeneo CPU/GPU e ottimizzazioni a livello di kernel per servire modelli come DeepSeek-V3/R1 con una o poche GPU consumer più RAM di sistema, esponendo un'API compatibile con OpenAI e una chat UI. È diventato noto per rendere eseguibili modelli MoE di dimensioni frontier su una singola workstation.

Repository

kvcache-ai/ktransformers

Linguaggio

Python

Cosa ci costruiresti

  • Esecuzione locale di grandi modelli MoE (DeepSeek-V3/R1) con offloading degli esperti su CPU+GPU
  • Serving di modelli di dimensioni frontier su una singola workstation con VRAM limitata ma ampia RAM
  • Sperimentazione con ottimizzazioni di inferenza a livello di kernel dietro un'API compatibile con OpenAI

Tag

servingmoeoffloadinglocal