Open SourceAnalytics9k
DeepEval
Le framework open-source d'évaluation LLM, comme Pytest pour les LLMs.
DeepEval est un framework d'évaluation open-source de Confident AI qui permet aux développeurs de faire des tests unitaires sur les sorties LLM de la même façon que Pytest teste du code. Il propose des métriques issues de la recherche académique, notamment G-Eval, la détection d'hallucinations, la pertinence des réponses, la fidélité et des scores spécifiques au RAG, et prend en charge les benchmarks, le red-teaming et les tests par composant. Il s'exécute localement et s'intègre dans les pipelines CI pour détecter les régressions avant le déploiement.
Dépôt
confident-ai/deepevalLangage
PythonCe que vous pourriez construire avec
- Écrire des assertions à la façon de Pytest sur des sorties LLM avec des métriques comme G-Eval et la détection d'hallucinations
- Benchmarker et red-teamer un modèle ou un agent avant de le mettre en production
- Exécuter automatiquement des évaluations RAG et chatbot en CI à chaque changement de prompt ou de modèle
Tags
evalsllm-testingred-teamingci