All åpen kildekode
Åpen kildekodeAnalytics9k

DeepEval

Det åpen kildekode LLM-evalueringsrammeverket, som Pytest for LLM-er.

DeepEval er et åpen kildekode evalueringsrammeverk fra Confident AI som lar utviklere enhetsteste LLM-utdata slik Pytest tester kode. Det leveres med forskningsbaserte metrikker inkludert G-Eval, hallusinasjon, svarsrelevans, troskap og RAG-spesifikke scorer, og støtter benchmarks, rødteaming og komponentnivå-testing. Det kjører lokalt og kobles inn i CI-rørledninger for å fange opp regresjoner før deploy.

Kodelager

confident-ai/deepeval

Språk

Python

Det du kan bygge med den

  • Skriv Pytest-style påstander over LLM-utdata med metrikker som G-Eval og hallusinasjon
  • Benchmark og rødteam en modell eller agent før du sender den til produksjon
  • Kjør RAG- og chatbot-evalueringer automatisk i CI ved hver prompt- eller modellendring

Tagger

evalsllm-testingred-teamingci