Tutto l'open source
Open SourceAnalytics9k

DeepEval

Il framework open-source di valutazione LLM, come Pytest per gli LLM.

DeepEval è un framework di valutazione open-source di Confident AI che permette agli sviluppatori di fare unit test sugli output LLM come Pytest fa con il codice. Include metriche validate dalla ricerca tra cui G-Eval, allucinazione, rilevanza delle risposte, faithfulness e score specifici per RAG, e supporta benchmark, red-teaming e test a livello di componente. Gira in locale e si integra nelle pipeline CI per rilevare regressioni prima del deploy.

Repository

confident-ai/deepeval

Linguaggio

Python

Cosa ci costruiresti

  • Scrivere asserzioni in stile Pytest sugli output LLM con metriche come G-Eval e allucinazione
  • Fare benchmark e red-team di un modello o agente prima di mandarlo in produzione
  • Eseguire automaticamente valutazioni RAG e chatbot in CI ad ogni modifica ai prompt o al modello

Tag

evalsllm-testingred-teamingci