Open SourceAnalytics9k
DeepEval
Das Open-Source-LLM-Evaluierungs-Framework, wie Pytest für LLMs.
DeepEval ist ein Open-Source-Evaluierungs-Framework von Confident AI, mit dem Entwickler LLM-Ausgaben so unit-testen können, wie Pytest Code testet. Es liefert forschungsgestützte Metriken, darunter G-Eval, Halluzination, Answer Relevancy, Faithfulness und RAG-spezifische Scores, und unterstützt Benchmarks, Red-Teaming und komponentenbasiertes Testen. Es läuft lokal und lässt sich in CI-Pipelines einbinden, um Regressionen vor dem Deployment zu erkennen.
Repository
confident-ai/deepevalSprache
PythonWas du damit bauen kannst
- Pytest-artige Assertions über LLM-Ausgaben mit Metriken wie G-Eval und Halluzination schreiben
- Ein Modell oder einen Agenten vor der Produktivschaltung benchmarken und red-teamen
- RAG- und Chatbot-Evals in CI bei jeder Prompt- oder Modelländerung automatisch ausführen
Tags
evalsllm-testingred-teamingci