Open SourceAnalytics9k
DeepEval
Det åpen kildekode LLM-evalueringsrammeverket, som Pytest for LLM-er.
DeepEval er et åpen kildekode evalueringsrammeverk fra Confident AI som lar utviklere enhetsteste LLM-utdata slik Pytest tester kode. Det leveres med forskningsbaserte metrikker inkludert G-Eval, hallusinasjon, svarsrelevans, troskap og RAG-spesifikke scorer, og støtter benchmarks, rødteaming og komponentnivå-testing. Det kjører lokalt og kobles inn i CI-rørledninger for å fange opp regresjoner før deploy.
Repository
confident-ai/deepevalLinguaggio
PythonCosa ci costruiresti
- Skriv Pytest-style påstander over LLM-utdata med metrikker som G-Eval og hallusinasjon
- Benchmark og rødteam en modell eller agent før du sender den til produksjon
- Kjør RAG- og chatbot-evalueringer automatisk i CI ved hver prompt- eller modellendring
Tag
evalsllm-testingred-teamingci