Todo el código abierto
Código abiertoScraping22k

GPT Crawler

Rastrea un sitio y genera un archivo de conocimiento para un GPT personalizado.

GPT Crawler es una herramienta Node.js que rastrea un sitio web desde una URL de inicio y ensambla el contenido extraído en un único archivo de conocimiento listo para impulsar un GPT personalizado o un asistente. Utiliza Playwright internamente con selectores configurables, patrones de coincidencia y límites de páginas. Destaca por simplificar el camino desde la documentación pública hasta una base de conocimiento lista para RAG.

Repositorio

BuilderIO/gpt-crawler

Lenguaje

TypeScript

Lo que construirías con esto

  • Construir un GPT personalizado o asistente fundamentado en el sitio de documentación de un producto
  • Generar un archivo de conocimiento consolidado para la ingesta en RAG
  • Hacer scraping de documentación en fragmentos de texto limpio para embeddings

Etiquetas

crawlingragknowledge-basellm