Alle Open Source
Open SourceAnalytics9k

DeepEval

Das Open-Source-LLM-Evaluierungs-Framework, wie Pytest für LLMs.

DeepEval ist ein Open-Source-Evaluierungs-Framework von Confident AI, mit dem Entwickler LLM-Ausgaben so unit-testen können, wie Pytest Code testet. Es liefert forschungsgestützte Metriken, darunter G-Eval, Halluzination, Answer Relevancy, Faithfulness und RAG-spezifische Scores, und unterstützt Benchmarks, Red-Teaming und komponentenbasiertes Testen. Es läuft lokal und lässt sich in CI-Pipelines einbinden, um Regressionen vor dem Deployment zu erkennen.

Repository

confident-ai/deepeval

Sprache

Python

Was du damit bauen kannst

  • Pytest-artige Assertions über LLM-Ausgaben mit Metriken wie G-Eval und Halluzination schreiben
  • Ein Modell oder einen Agenten vor der Produktivschaltung benchmarken und red-teamen
  • RAG- und Chatbot-Evals in CI bei jeder Prompt- oder Modelländerung automatisch ausführen

Tags

evalsllm-testingred-teamingci