Código abiertoAnalytics9k
Ragas
Kit de evaluación para pipelines RAG y aplicaciones LLM.
Ragas es un framework open-source para evaluar y probar aplicaciones LLM, con un fuerte enfoque en la generación aumentada por recuperación. Proporciona métricas sin referencia como fidelidad, relevancia de respuesta y precisión/recall de contexto, además de herramientas para generar conjuntos de prueba sintéticos. Se integra con LangChain, LlamaIndex y herramientas de observabilidad para incorporar puntuaciones objetivas en CI y bucles de experimentación.
Repositorio
explodinggradients/ragasLenguaje
PythonLo que construirías con esto
- Puntuar respuestas RAG por fidelidad y relevancia del contexto sin etiquetas manuales
- Generar conjuntos de preguntas y respuestas sintéticas para evaluar un pipeline de recuperación
- Controlar cambios de modelo o de prompt en CI haciendo seguimiento de métricas de evaluación a lo largo del tiempo
Etiquetas
evalsragllm-testingmetrics