Open SourceScraping22k
GPT Crawler
Eine Website crawlen und eine Wissensdatei für einen Custom GPT erstellen.
GPT Crawler ist ein Node.js-Tool, das eine Website von einer Start-URL aus crawlt und die extrahierten Inhalte zu einer einzelnen Wissensdatei zusammenstellt, die bereit ist, einen Custom GPT oder Assistenten zu betreiben. Es verwendet Playwright im Hintergrund mit konfigurierbaren Selektoren, Match-Patterns und Seiten-Limits. Besonders hervorzuheben ist die Vereinfachung des Wegs von öffentlicher Dokumentation zu einer RAG-bereiten Wissensdatenbank.
Repository
BuilderIO/gpt-crawlerSprache
TypeScriptWas du damit bauen kannst
- Einen Custom GPT oder Assistenten aufbauen, der auf der Dokumentationsseite eines Produkts basiert
- Eine konsolidierte Wissensdatei für die RAG-Ingestion generieren
- Dokumentation in saubere Textchunks für Embeddings scrapen
Tags
crawlingragknowledge-basellm