Open SourceScraping17k
Crawlee
Bibliothèque de crawling en production avec files d'attente, rotation de proxies et gestion des sessions.
Crawlee est une bibliothèque de web scraping et d'automatisation de navigateur développée par Apify pour construire des crawlers fiables en Node.js/TypeScript et Python. Elle propose des crawlers HTTP et headless unifiés (Playwright, Puppeteer), la mise en file d'attente automatique des requêtes, la rotation de proxies et des fonctionnalités anti-blocage. Elle se distingue par la gestion de l'état du crawl, la montée en charge et les nouvelles tentatives, tout inclus par défaut.
Dépôt
apify/crawleeLangage
TypeScriptCe que vous pourriez construire avec
- Construire des crawlers à grande échelle avec mise en file d'attente et nouvelles tentatives automatiques
- Faire tourner les proxies et gérer les sessions pour éviter les blocages
- Crawler des sites à forte teneur en JavaScript avec des navigateurs headless gérés
Tags
crawlingscrapingproxy