Open SourceScraping22k
GPT Crawler
Fai il crawl di un sito e genera un file di conoscenza per un GPT personalizzato.
GPT Crawler è uno strumento Node.js che fa il crawl di un sito web a partire da un URL iniziale e assembla il contenuto estratto in un unico file di conoscenza pronto ad alimentare un GPT personalizzato o un assistant. Usa Playwright internamente con selettori, pattern di match e limiti di pagina configurabili. Si distingue per semplificare il percorso dalla documentazione pubblica a una knowledge base funzionante pronta per il RAG.
Repository
BuilderIO/gpt-crawlerLinguaggio
TypeScriptCosa ci costruiresti
- Costruire un GPT personalizzato o un assistant basato sul sito della documentazione di un prodotto
- Generare un file di conoscenza consolidato per l'ingestione RAG
- Fare scraping della documentazione in chunk di testo puliti per gli embedding
Tag
crawlingragknowledge-basellm