Open SourceScraping55k
Scrapy
Il framework Python collaudato per il web crawling su larga scala.
Scrapy è un framework open-source veloce e maturo per il crawling di siti web e l'estrazione di dati strutturati su larga scala, costruito su un core asincrono basato su Twisted. Fornisce spider, pipeline di item, middleware, autothrottling e supporto nativo per i selettori, rendendolo lo standard de facto per lo scraping Python in produzione. Si distingue per la sua estensibilità e l'ecosistema di plugin e strumenti di deployment.
Repository
scrapy/scrapyLinguaggio
PythonCosa ci costruiresti
- Costruire crawler in produzione per raccogliere dataset di training o RAG su larga scala
- Eseguire scrape distribuiti e schedulati con middleware di throttling e retry
- Estrarre item strutturati in feed JSON/CSV per pipeline downstream
Tag
crawlingscrapingframeworkpython