كل المشاريع مفتوحة المصدر
مفتوح المصدرمحلي83k

llama.cpp

محرك استدلال LLM بلغة C/C++ مع التكميم؛ يعمل في أي مكان تقريبًا.

llama.cpp محرك استدلال بلغة C/C++ لتشغيل نماذج LLM بكفاءة على الأجهزة الاعتيادية بما فيها وحدات المعالجة المركزية ومجموعة واسعة من وحدات GPU. ريادي في صيغة نماذج GGUF والتكميم الحاد (مثل 4-بت و5-بت) الذي يتيح تشغيل النماذج الكبيرة على الأجهزة الاستهلاكية، وهو الأساس الذي تقوم عليه كثير من أدوات LLM المحلية عالية المستوى. يأتي مع CLI وخادم بـ API متوافقة مع OpenAI وارتباطات تُستخدم في أنحاء النظام البيئي.

المستودع

ggml-org/llama.cpp

اللغة

C++

ما الذي يمكنك بناؤه به

  • تشغيل نماذج GGUF المكمّمة على وحدة المعالجة المركزية أو وحدات GPU محدودة حيث لا تصلح الأطر الأثقل
  • تضمين استدلال LLM منخفض المستوى مباشرةً في تطبيقات C/C++ أو تطبيقات الحافة
  • تقديم النماذج المحلية عبر الخادم المدمج المتوافق مع OpenAI لتكاملها في التطبيقات

الوسوم

inferencequantizationcpu