Alle Open Source
Open SourceScraping22k

GPT Crawler

Eine Website crawlen und eine Wissensdatei für einen Custom GPT erstellen.

GPT Crawler ist ein Node.js-Tool, das eine Website von einer Start-URL aus crawlt und die extrahierten Inhalte zu einer einzelnen Wissensdatei zusammenstellt, die bereit ist, einen Custom GPT oder Assistenten zu betreiben. Es verwendet Playwright im Hintergrund mit konfigurierbaren Selektoren, Match-Patterns und Seiten-Limits. Besonders hervorzuheben ist die Vereinfachung des Wegs von öffentlicher Dokumentation zu einer RAG-bereiten Wissensdatenbank.

Repository

BuilderIO/gpt-crawler

Sprache

TypeScript

Was du damit bauen kannst

  • Einen Custom GPT oder Assistenten aufbauen, der auf der Dokumentationsseite eines Produkts basiert
  • Eine konsolidierte Wissensdatei für die RAG-Ingestion generieren
  • Dokumentation in saubere Textchunks für Embeddings scrapen

Tags

crawlingragknowledge-basellm