Todo el código abierto
Código abiertoAnalytics9k

DeepEval

El framework open-source de evaluación de LLMs, como Pytest para LLMs.

DeepEval es un framework open-source de evaluación de Confident AI que permite a los desarrolladores hacer pruebas unitarias sobre salidas de LLMs del mismo modo que Pytest prueba código. Incluye métricas respaldadas por investigación como G-Eval, alucinación, relevancia de respuesta, fidelidad y puntuaciones específicas para RAG, y admite benchmarks, red-teaming y pruebas a nivel de componente. Se ejecuta localmente y se conecta a pipelines de CI para detectar regresiones antes del despliegue.

Repositorio

confident-ai/deepeval

Lenguaje

Python

Lo que construirías con esto

  • Escribir aserciones al estilo Pytest sobre salidas de LLMs con métricas como G-Eval y alucinación
  • Hacer benchmark y red-teaming de un modelo o agente antes de llevarlo a producción
  • Ejecutar evaluaciones de RAG y chatbot automáticamente en CI con cada cambio de prompt o modelo

Etiquetas

evalsllm-testingred-teamingci