Alle open source
Open SourceAnalytics9k

DeepEval

Het open-source LLM-evaluatieframework, zoals Pytest maar dan voor LLM's.

DeepEval is een open-source evaluatieframework van Confident AI waarmee ontwikkelaars LLM-outputs kunnen unit-testen op dezelfde manier als Pytest code test. Het bevat door onderzoek ondersteunde metrics zoals G-Eval, hallucinatie, antwoordrelevantie, faithfulness en RAG-specifieke scores, en ondersteunt benchmarks, red-teaming en componentniveautesting. Het draait lokaal en koppelt aan CI-pipelines om regressies v贸贸r deployent op te vangen.

Opslagplaats

confident-ai/deepeval

Taal

Python

Wat je ermee zou bouwen

  • Schrijf Pytest-achtige assertions over LLM-outputs met metrics zoals G-Eval en hallucinatie
  • Benchmark en red-team een model of agent voordat je het naar productie brengt
  • Voer RAG- en chatbot-evaluaties automatisch uit in CI bij elke prompt- of modelwijziging

Tags

evalsllm-testingred-teamingci