Open SourceScraping55k
Scrapy
Das bewährte Python-Framework für großangelegtes Web-Crawling.
Scrapy ist ein schnelles, ausgereiftes, quelloffenes Framework zum Crawlen von Websites und zum Extrahieren strukturierter Daten in großem Maßstab, aufgebaut auf einem asynchronen Twisted-Kern. Es bietet Spiders, Item-Pipelines, Middlewares, Auto-Throttling und integrierte Unterstützung für Selektoren und ist damit der de-facto-Standard für produktives Python-Scraping. Besonders hervorzuheben sind seine Erweiterbarkeit und das umfangreiche Ökosystem aus Plugins und Deployment-Tools.
Repository
scrapy/scrapySprache
PythonWas du damit bauen kannst
- Produktive Crawler bauen, die Trainings- oder RAG-Datensätze in großem Maßstab sammeln
- Geplante, verteilte Scrapes mit Throttling- und Retry-Middleware betreiben
- Strukturierte Items in JSON/CSV-Feeds für nachgelagerte Pipelines extrahieren
Tags
crawlingscrapingframeworkpython