Tutto l'open source
Open SourceScraping55k

Scrapy

Il framework Python collaudato per il web crawling su larga scala.

Scrapy è un framework open-source veloce e maturo per il crawling di siti web e l'estrazione di dati strutturati su larga scala, costruito su un core asincrono basato su Twisted. Fornisce spider, pipeline di item, middleware, autothrottling e supporto nativo per i selettori, rendendolo lo standard de facto per lo scraping Python in produzione. Si distingue per la sua estensibilità e l'ecosistema di plugin e strumenti di deployment.

Repository

scrapy/scrapy

Linguaggio

Python

Cosa ci costruiresti

  • Costruire crawler in produzione per raccogliere dataset di training o RAG su larga scala
  • Eseguire scrape distribuiti e schedulati con middleware di throttling e retry
  • Estrarre item strutturati in feed JSON/CSV per pipeline downstream

Tag

crawlingscrapingframeworkpython