كل المشاريع مفتوحة المصدر
مفتوح المصدرتحليلات9k

DeepEval

إطار تقييم LLM مفتوح المصدر، مثل Pytest لنماذج اللغة الكبيرة.

DeepEval إطار تقييم مفتوح المصدر من Confident AI يُتيح للمطورين اختبار مخرجات LLM باستخدام وحدات اختبار بنفس طريقة Pytest. يأتي بمقاييس مدعومة بالأبحاث تشمل G-Eval والهلوسة وصلة الإجابة والأمانة ودرجات خاصة بـ RAG، كما يدعم المعايير المرجعية والاختبار الأحمر والاختبار على مستوى المكوّنات. يعمل محلياً ويتّصل بخطوط CI لرصد الانحدارات قبل النشر.

المستودع

confident-ai/deepeval

اللغة

Python

ما الذي يمكنك بناؤه به

  • كتابة تأكيدات بأسلوب Pytest على مخرجات LLM بمقاييس مثل G-Eval والهلوسة
  • قياس أداء نموذج أو وكيل واختباره أحمراً قبل شحنه إلى الإنتاج
  • تشغيل تقييمات RAG والمحادثة تلقائياً في CI عند كل تغيير في الموجّه أو النموذج

الوسوم

evalsllm-testingred-teamingci