Open SourceScraping22k
GPT Crawler
Crawlez un site et produisez un fichier de connaissances pour un GPT personnalisé.
GPT Crawler est un outil Node.js qui crawle un site web depuis une URL de départ et assemble le contenu extrait dans un fichier de connaissances unique prêt à alimenter un GPT personnalisé ou un assistant. Il utilise Playwright en interne avec des sélecteurs, des patterns de correspondance et des limites de pages configurables. Il se distingue en simplifiant le chemin de la documentation publique vers une base de connaissances fonctionnelle prête pour le RAG.
Dépôt
BuilderIO/gpt-crawlerLangage
TypeScriptCe que vous pourriez construire avec
- Construire un GPT ou assistant personnalisé ancré dans le site de documentation d'un produit
- Générer un fichier de connaissances consolidé pour l'ingestion RAG
- Scraper de la documentation en chunks de texte propres pour les embeddings
Tags
crawlingragknowledge-basellm