Tout l'open source
Open SourceAnalytics9k

DeepEval

Le framework open-source d'évaluation LLM, comme Pytest pour les LLMs.

DeepEval est un framework d'évaluation open-source de Confident AI qui permet aux développeurs de faire des tests unitaires sur les sorties LLM de la même façon que Pytest teste du code. Il propose des métriques issues de la recherche académique, notamment G-Eval, la détection d'hallucinations, la pertinence des réponses, la fidélité et des scores spécifiques au RAG, et prend en charge les benchmarks, le red-teaming et les tests par composant. Il s'exécute localement et s'intègre dans les pipelines CI pour détecter les régressions avant le déploiement.

Dépôt

confident-ai/deepeval

Langage

Python

Ce que vous pourriez construire avec

  • Écrire des assertions à la façon de Pytest sur des sorties LLM avec des métriques comme G-Eval et la détection d'hallucinations
  • Benchmarker et red-teamer un modèle ou un agent avant de le mettre en production
  • Exécuter automatiquement des évaluations RAG et chatbot en CI à chaque changement de prompt ou de modèle

Tags

evalsllm-testingred-teamingci