Código abiertoScraping55k
Scrapy
El framework Python para crawling web a gran escala, probado en producción.
Scrapy es un framework de código abierto, rápido y maduro para rastrear sitios web y extraer datos estructurados a escala, construido sobre un núcleo asíncrono con Twisted. Ofrece spiders, pipelines de ítems, middlewares, autorregulación del ritmo y soporte integrado para selectores, convirtiéndolo en el estándar de facto para el scraping Python en producción. Destaca por su extensibilidad y el ecosistema de plugins y herramientas de despliegue que lo rodean.
Repositorio
scrapy/scrapyLenguaje
PythonLo que construirías con esto
- Construir crawlers de producción que recopilan conjuntos de datos de entrenamiento o RAG a gran escala
- Ejecutar scrapes programados y distribuidos con middleware de throttling y reintentos
- Extraer ítems estructurados en feeds JSON/CSV para pipelines de datos posteriores
Etiquetas
crawlingscrapingframeworkpython