Open SourceScraping22k
GPT Crawler
Een site crawlen en een kennisbestand genereren voor een aangepaste GPT.
GPT Crawler is een Node.js-tool die een website crawlt vanaf een start-URL en de geëxtraheerde inhoud samenvoegt tot één kennisbestand dat klaar is om een aangepaste GPT of assistent aan te drijven. Het gebruikt Playwright onder de motorkap met configureerbare selectors, matchpatronen en paginalimieten. Het is opvallend doordat het het pad van publieke documentatie naar een werkende RAG-klare kennisbank stroomlijnt.
Opslagplaats
BuilderIO/gpt-crawlerTaal
TypeScriptWat je ermee zou bouwen
- Een aangepaste GPT of assistent bouwen die is verankerd in de documentatiesite van een product
- Een geconsolideerd kennisbestand genereren voor RAG-ingestie
- Documentatie scrapen naar schone tekstchunks voor embeddings
Tags
crawlingragknowledge-basellm