كل المشاريع مفتوحة المصدر
مفتوح المصدراستدلال14k

KTransformers

تشغيل نماذج MoE الضخمة محليًا بتفريغ الخبراء إلى CPU و GPU.

KTransformers هو إطار مفتوح المصدر من KVCache.AI بجامعة Tsinghua لتحسين الاستنتاج المحلي للنماذج اللغوية الكبيرة، مع تركيز على تشغيل نماذج مزيج الخبراء الكبيرة جدًا على أجهزة متواضعة. يستخدم تفريغًا غير متجانس بين CPU/GPU وتحسينات على مستوى النواة لخدمة نماذج مثل DeepSeek-V3/R1 بـ GPU أو بعض GPUs للمستهلكين وذاكرة RAM للنظام، مع عرض API متوافق مع OpenAI وواجهة دردشة. اشتُهر بجعل نماذج MoE بحجم الحدود الأمامية قابلةً للتشغيل على محطة عمل واحدة.

المستودع

kvcache-ai/ktransformers

اللغة

Python

ما الذي يمكنك بناؤه به

  • تشغيل نماذج MoE الكبيرة (DeepSeek-V3/R1) محليًا مع تفريغ الخبراء عبر CPU+GPU
  • خدمة النماذج بحجم الحدود الأمامية على محطة عمل واحدة بذاكرة VRAM محدودة وذاكرة RAM وفيرة
  • التجريب مع تحسينات الاستنتاج على مستوى النواة من خلال API متوافق مع OpenAI

الوسوم

servingmoeoffloadinglocal