Todo el código abierto
Código abiertoScraping55k

Scrapy

El framework Python para crawling web a gran escala, probado en producción.

Scrapy es un framework de código abierto, rápido y maduro para rastrear sitios web y extraer datos estructurados a escala, construido sobre un núcleo asíncrono con Twisted. Ofrece spiders, pipelines de ítems, middlewares, autorregulación del ritmo y soporte integrado para selectores, convirtiéndolo en el estándar de facto para el scraping Python en producción. Destaca por su extensibilidad y el ecosistema de plugins y herramientas de despliegue que lo rodean.

Repositorio

scrapy/scrapy

Lenguaje

Python

Lo que construirías con esto

  • Construir crawlers de producción que recopilan conjuntos de datos de entrenamiento o RAG a gran escala
  • Ejecutar scrapes programados y distribuidos con middleware de throttling y reintentos
  • Extraer ítems estructurados en feeds JSON/CSV para pipelines de datos posteriores

Etiquetas

crawlingscrapingframeworkpython