Tüm açık kaynaklar
Açık KaynakAnalitik9k

DeepEval

LLM'ler için Pytest gibi çalışan açık kaynaklı LLM değerlendirme framework'ü.

DeepEval, Confident AI tarafından geliştirilen ve geliştiricilerin LLM çıktılarını Pytest'in kodu test ettiği gibi birim test etmesine olanak tanıyan açık kaynaklı bir değerlendirme framework'üdür. Araştırma destekli G-Eval, hallüsinasyon, yanıt ilgisi, sadakat ve RAG'a özgü puanlar gibi metriklerle birlikte benchmark, kırmızı takım ve bileşen düzeyi testleri destekler. Yerel ortamda çalışır ve dağıtım öncesi regresyonları yakalamak için CI pipeline'larına entegre olur.

Depo

confident-ai/deepeval

Dil

Python

Bununla neler kurabilirsin

  • G-Eval ve hallüsinasyon gibi metriklerle LLM çıktıları üzerinde Pytest tarzı doğrulamalar yazma
  • Modeli veya ajanı üretime göndermeden önce benchmark ve kırmızı takım testleri yapma
  • Her istem veya model değişikliğinde CI'da RAG ve sohbet botu değerlendirmelerini otomatik olarak çalıştırma

Etiketler

evalsllm-testingred-teamingci