Öppen källkodAnalys9k
DeepEval
Det öppna källkods-ramverket för LLM-utvärdering, som Pytest för LLM:er.
DeepEval är ett ramverk med öppen källkod för utvärdering från Confident AI som låter utvecklare enhetstesta LLM-utdata på samma sätt som Pytest testar kod. Det levereras med forskningsbaserade mätvärden inklusive G-Eval, hallucination, svarsrelevans, trovärdighet och RAG-specifika poäng, och stöder benchmarks, red-teaming och komponentnivåtestning. Det körs lokalt och kopplas in i CI-pipelines för att fånga regressioner innan driftsättning.
Kodförråd
confident-ai/deepevalSpråk
PythonVad du kan bygga med det
- Skriv Pytest-liknande påståenden för LLM-utdata med mätvärden som G-Eval och hallucination
- Benchmarka och red-teama en modell eller agent innan den skickas till produktion
- Kör RAG- och chattbotsutvärderingar automatiskt i CI vid varje prompt- eller modellförändring
Taggar
evalsllm-testingred-teamingci