Tutto l'open source
Open SourceScraping22k

GPT Crawler

Fai il crawl di un sito e genera un file di conoscenza per un GPT personalizzato.

GPT Crawler è uno strumento Node.js che fa il crawl di un sito web a partire da un URL iniziale e assembla il contenuto estratto in un unico file di conoscenza pronto ad alimentare un GPT personalizzato o un assistant. Usa Playwright internamente con selettori, pattern di match e limiti di pagina configurabili. Si distingue per semplificare il percorso dalla documentazione pubblica a una knowledge base funzionante pronta per il RAG.

Repository

BuilderIO/gpt-crawler

Linguaggio

TypeScript

Cosa ci costruiresti

  • Costruire un GPT personalizzato o un assistant basato sul sito della documentazione di un prodotto
  • Generare un file di conoscenza consolidato per l'ingestione RAG
  • Fare scraping della documentazione in chunk di testo puliti per gli embedding

Tag

crawlingragknowledge-basellm