Tout l'open source
Open SourceScraping22k

GPT Crawler

Crawlez un site et produisez un fichier de connaissances pour un GPT personnalisé.

GPT Crawler est un outil Node.js qui crawle un site web depuis une URL de départ et assemble le contenu extrait dans un fichier de connaissances unique prêt à alimenter un GPT personnalisé ou un assistant. Il utilise Playwright en interne avec des sélecteurs, des patterns de correspondance et des limites de pages configurables. Il se distingue en simplifiant le chemin de la documentation publique vers une base de connaissances fonctionnelle prête pour le RAG.

Dépôt

BuilderIO/gpt-crawler

Langage

TypeScript

Ce que vous pourriez construire avec

  • Construire un GPT ou assistant personnalisé ancré dans le site de documentation d'un produit
  • Générer un fichier de connaissances consolidé pour l'ingestion RAG
  • Scraper de la documentation en chunks de texte propres pour les embeddings

Tags

crawlingragknowledge-basellm