All öppen källkod
Öppen källkodAnalys9k

DeepEval

Det öppna källkods-ramverket för LLM-utvärdering, som Pytest för LLM:er.

DeepEval är ett ramverk med öppen källkod för utvärdering från Confident AI som låter utvecklare enhetstesta LLM-utdata på samma sätt som Pytest testar kod. Det levereras med forskningsbaserade mätvärden inklusive G-Eval, hallucination, svarsrelevans, trovärdighet och RAG-specifika poäng, och stöder benchmarks, red-teaming och komponentnivåtestning. Det körs lokalt och kopplas in i CI-pipelines för att fånga regressioner innan driftsättning.

Kodförråd

confident-ai/deepeval

Språk

Python

Vad du kan bygga med det

  • Skriv Pytest-liknande påståenden för LLM-utdata med mätvärden som G-Eval och hallucination
  • Benchmarka och red-teama en modell eller agent innan den skickas till produktion
  • Kör RAG- och chattbotsutvärderingar automatiskt i CI vid varje prompt- eller modellförändring

Taggar

evalsllm-testingred-teamingci