Açık KaynakÇıkarım14k
KTransformers
Büyük MoE modellerini CPU ve GPU'ya expert offloading yaparak yerel olarak çalıştırın.
KTransformers, Tsinghua'nın KVCache.AI ekibinden gelen açık kaynaklı bir framework olup optimize edilmiş yerel LLM çıkarımına odaklanır ve çok büyük uzman karışımı modellerini mütevazı donanımlarda çalıştırmayı hedefler. Heterojen CPU/GPU offloading ve çekirdek optimizasyonlarını kullanarak DeepSeek-V3/R1 gibi modelleri yalnızca bir veya birkaç tüketici GPU'su ile sistem RAM'i üzerinden sunar; OpenAI uyumlu API ve sohbet UI ile birlikte gelir. Sınır ölçeğindeki MoE modellerini tek bir iş istasyonunda çalıştırmayı mümkün kılmasıyla geniş kitlelere ulaşmıştır.
Depo
kvcache-ai/ktransformersDil
PythonBununla neler kurabilirsin
- Büyük MoE modellerini (DeepSeek-V3/R1) CPU+GPU expert offloading ile yerel olarak çalıştırma
- Sınırlı VRAM'e sahip ancak yeterli RAM'i olan tek bir iş istasyonunda sınır ölçeğindeki modelleri sunma
- OpenAI uyumlu API arkasında çekirdek düzeyinde çıkarım optimizasyonlarını deneme
Etiketler
servingmoeoffloadinglocal