Open SourceScraping55k
Scrapy
Le framework Python éprouvé pour le crawling web à grande échelle.
Scrapy est un framework open-source rapide et mature pour crawler des sites web et extraire des données structurées à grande échelle, construit sur un noyau asynchrone Twisted. Il fournit des spiders, des pipelines d'items, des middlewares, l'autothrottling et un support intégré des sélecteurs, faisant de lui le standard de facto pour le scraping Python en production. Il se distingue par son extensibilité et l'écosystème qui l'entoure en termes de plugins et d'outillage de déploiement.
Dépôt
scrapy/scrapyLangage
PythonCe que vous pourriez construire avec
- Construire des crawlers de production qui récoltent des jeux de données d'entraînement ou RAG à grande échelle
- Lancer des scrapes planifiés et distribués avec du throttling et des middlewares de retry
- Extraire des items structurés dans des flux JSON/CSV pour des pipelines en aval
Tags
crawlingscrapingframeworkpython