Åpen kildekodeAnalytics9k
DeepEval
Det åpen kildekode LLM-evalueringsrammeverket, som Pytest for LLM-er.
DeepEval er et åpen kildekode evalueringsrammeverk fra Confident AI som lar utviklere enhetsteste LLM-utdata slik Pytest tester kode. Det leveres med forskningsbaserte metrikker inkludert G-Eval, hallusinasjon, svarsrelevans, troskap og RAG-spesifikke scorer, og støtter benchmarks, rødteaming og komponentnivå-testing. Det kjører lokalt og kobles inn i CI-rørledninger for å fange opp regresjoner før deploy.
Kodelager
confident-ai/deepevalSpråk
PythonDet du kan bygge med den
- Skriv Pytest-style påstander over LLM-utdata med metrikker som G-Eval og hallusinasjon
- Benchmark og rødteam en modell eller agent før du sender den til produksjon
- Kjør RAG- og chatbot-evalueringer automatisk i CI ved hver prompt- eller modellendring
Tagger
evalsllm-testingred-teamingci