Açık KaynakAnalitik9k
DeepEval
LLM'ler için Pytest gibi çalışan açık kaynaklı LLM değerlendirme framework'ü.
DeepEval, Confident AI tarafından geliştirilen ve geliştiricilerin LLM çıktılarını Pytest'in kodu test ettiği gibi birim test etmesine olanak tanıyan açık kaynaklı bir değerlendirme framework'üdür. Araştırma destekli G-Eval, hallüsinasyon, yanıt ilgisi, sadakat ve RAG'a özgü puanlar gibi metriklerle birlikte benchmark, kırmızı takım ve bileşen düzeyi testleri destekler. Yerel ortamda çalışır ve dağıtım öncesi regresyonları yakalamak için CI pipeline'larına entegre olur.
Depo
confident-ai/deepevalDil
PythonBununla neler kurabilirsin
- G-Eval ve hallüsinasyon gibi metriklerle LLM çıktıları üzerinde Pytest tarzı doğrulamalar yazma
- Modeli veya ajanı üretime göndermeden önce benchmark ve kırmızı takım testleri yapma
- Her istem veya model değişikliğinde CI'da RAG ve sohbet botu değerlendirmelerini otomatik olarak çalıştırma
Etiketler
evalsllm-testingred-teamingci