Código abiertoAnalytics9k
DeepEval
El framework open-source de evaluación de LLMs, como Pytest para LLMs.
DeepEval es un framework open-source de evaluación de Confident AI que permite a los desarrolladores hacer pruebas unitarias sobre salidas de LLMs del mismo modo que Pytest prueba código. Incluye métricas respaldadas por investigación como G-Eval, alucinación, relevancia de respuesta, fidelidad y puntuaciones específicas para RAG, y admite benchmarks, red-teaming y pruebas a nivel de componente. Se ejecuta localmente y se conecta a pipelines de CI para detectar regresiones antes del despliegue.
Repositorio
confident-ai/deepevalLenguaje
PythonLo que construirías con esto
- Escribir aserciones al estilo Pytest sobre salidas de LLMs con métricas como G-Eval y alucinación
- Hacer benchmark y red-teaming de un modelo o agente antes de llevarlo a producción
- Ejecutar evaluaciones de RAG y chatbot automáticamente en CI con cada cambio de prompt o modelo
Etiquetas
evalsllm-testingred-teamingci