Open SourceAnalytics9k
DeepEval
Il framework open-source di valutazione LLM, come Pytest per gli LLM.
DeepEval è un framework di valutazione open-source di Confident AI che permette agli sviluppatori di fare unit test sugli output LLM come Pytest fa con il codice. Include metriche validate dalla ricerca tra cui G-Eval, allucinazione, rilevanza delle risposte, faithfulness e score specifici per RAG, e supporta benchmark, red-teaming e test a livello di componente. Gira in locale e si integra nelle pipeline CI per rilevare regressioni prima del deploy.
Repository
confident-ai/deepevalLinguaggio
PythonCosa ci costruiresti
- Scrivere asserzioni in stile Pytest sugli output LLM con metriche come G-Eval e allucinazione
- Fare benchmark e red-team di un modello o agente prima di mandarlo in produzione
- Eseguire automaticamente valutazioni RAG e chatbot in CI ad ogni modifica ai prompt o al modello
Tag
evalsllm-testingred-teamingci