Alle Open Source
Open SourceScraping55k

Scrapy

Das bewährte Python-Framework für großangelegtes Web-Crawling.

Scrapy ist ein schnelles, ausgereiftes, quelloffenes Framework zum Crawlen von Websites und zum Extrahieren strukturierter Daten in großem Maßstab, aufgebaut auf einem asynchronen Twisted-Kern. Es bietet Spiders, Item-Pipelines, Middlewares, Auto-Throttling und integrierte Unterstützung für Selektoren und ist damit der de-facto-Standard für produktives Python-Scraping. Besonders hervorzuheben sind seine Erweiterbarkeit und das umfangreiche Ökosystem aus Plugins und Deployment-Tools.

Repository

scrapy/scrapy

Sprache

Python

Was du damit bauen kannst

  • Produktive Crawler bauen, die Trainings- oder RAG-Datensätze in großem Maßstab sammeln
  • Geplante, verteilte Scrapes mit Throttling- und Retry-Middleware betreiben
  • Strukturierte Items in JSON/CSV-Feeds für nachgelagerte Pipelines extrahieren

Tags

crawlingscrapingframeworkpython