Tüm açık kaynaklar
Açık KaynakÇıkarım14k

KTransformers

Büyük MoE modellerini CPU ve GPU'ya expert offloading yaparak yerel olarak çalıştırın.

KTransformers, Tsinghua'nın KVCache.AI ekibinden gelen açık kaynaklı bir framework olup optimize edilmiş yerel LLM çıkarımına odaklanır ve çok büyük uzman karışımı modellerini mütevazı donanımlarda çalıştırmayı hedefler. Heterojen CPU/GPU offloading ve çekirdek optimizasyonlarını kullanarak DeepSeek-V3/R1 gibi modelleri yalnızca bir veya birkaç tüketici GPU'su ile sistem RAM'i üzerinden sunar; OpenAI uyumlu API ve sohbet UI ile birlikte gelir. Sınır ölçeğindeki MoE modellerini tek bir iş istasyonunda çalıştırmayı mümkün kılmasıyla geniş kitlelere ulaşmıştır.

Depo

kvcache-ai/ktransformers

Dil

Python

Bununla neler kurabilirsin

  • Büyük MoE modellerini (DeepSeek-V3/R1) CPU+GPU expert offloading ile yerel olarak çalıştırma
  • Sınırlı VRAM'e sahip ancak yeterli RAM'i olan tek bir iş istasyonunda sınır ölçeğindeki modelleri sunma
  • OpenAI uyumlu API arkasında çekirdek düzeyinde çıkarım optimizasyonlarını deneme

Etiketler

servingmoeoffloadinglocal