Open SourceAnalytics9k
DeepEval
Het open-source LLM-evaluatieframework, zoals Pytest maar dan voor LLM's.
DeepEval is een open-source evaluatieframework van Confident AI waarmee ontwikkelaars LLM-outputs kunnen unit-testen op dezelfde manier als Pytest code test. Het bevat door onderzoek ondersteunde metrics zoals G-Eval, hallucinatie, antwoordrelevantie, faithfulness en RAG-specifieke scores, en ondersteunt benchmarks, red-teaming en componentniveautesting. Het draait lokaal en koppelt aan CI-pipelines om regressies v贸贸r deployent op te vangen.
Opslagplaats
confident-ai/deepevalTaal
PythonWat je ermee zou bouwen
- Schrijf Pytest-achtige assertions over LLM-outputs met metrics zoals G-Eval en hallucinatie
- Benchmark en red-team een model of agent voordat je het naar productie brengt
- Voer RAG- en chatbot-evaluaties automatisch uit in CI bij elke prompt- of modelwijziging
Tags
evalsllm-testingred-teamingci