Aller au contenu

Blog

Perspectives et ingénierie

Une analyse approfondie de l'infrastructure des données Web, des techniques d'extraction et de l'avenir des données structurées à grande échelle.

Derniers articles

181 articles

Comment utiliser un proxy dans Node-Fetch : Un guide pratique
Guides

Comment utiliser un proxy dans Node-Fetch : Un guide pratique

TL;DR : Node-Fetch n'a pas de commutateur proxy intégré, vous devez donc connecter un agent HTTP, HTTPS ou SOCKS5 à la requête via son option agent. Ce guide explique comment utiliser un proxy dans Node-Fetch de bout en bout : proxy HTTP et HTTPS authentifiés, SOCKS5, rotation, tentatives, cas limites de TLS, dépannage, et la route moderne undici pour Node 18+ native fetch.

Mihnea-Octavian Manolache13 min read
Lire l'article
Web Scraping JavaScript Tables in Python : Des API cachées à Playwright
Guides

Web Scraping JavaScript Tables in Python : Des API cachées à Playwright

TL;DR : Le scraping de tables JavaScript en Python nécessite rarement un navigateur sans tête. Ouvrez DevTools, trouvez le point de terminaison JSON qui hydrate la grille, rejouez-le avec des requêtes, paginez-le, et ne revenez à Playwright que lorsque l'appel réseau est signé, crypté ou autrement scellé.

Andrei Ogiolan13 min read
Lire l'article
Comment récupérer des tableaux HTML en Golang avec Colly : Guide de bout en bout
Guides

Comment récupérer des tableaux HTML en Golang avec Colly : Guide de bout en bout

TL;DR : Ce guide montre comment récupérer des tableaux HTML dans Golang de bout en bout : choisir entre Colly, goquery, et golang.org/x/net/html, cibler le bon <tbody>, modéliser les lignes comme une structure typée, et exporter du JSON et du CSV propre. Vous bénéficiez également de la pagination, de l'anti-blocage et de modèles de tableaux rendus par JavaScript.

Andrei Ogiolan12 min read
Lire l'article
Playwright Web Scraping : Le guide complet pour Python et Node.js
Guides

Playwright Web Scraping : Le guide complet pour Python et Node.js

TL;DR : Playwright vous offre une automatisation complète du navigateur pour le scraping de sites à forte composante JavaScript, avec un support de premier ordre pour Python et Node.js. Ce guide vous accompagne dans l'installation, l'extraction d'éléments, la configuration du proxy, l'anti-détection, la pagination, le téléchargement d'images et l'exportation de données au format CSV ou JSON, le tout avec des exemples de code côte à côte dans les deux langages.

Mihnea-Octavian Manolache17 min read
Lire l'article
Comment récupérer des avis sur Google Maps : Un guide pratique en Python
Guides

Comment récupérer des avis sur Google Maps : Un guide pratique en Python

TL;DR : La recherche d'avis sur Google Maps se résume à trois méthodes : un scraper Selenium bricolé derrière un proxy rotatif, une API de scraping avec des instructions de rendu, ou une API Maps Reviews structurée qui renvoie du JSON analysé. Ce guide présente les trois méthodes en Python avec du code à copier-coller, des modèles de pagination, des tactiques anti-blocage et une étape finale de nettoyage qui transforme les avis bruts en quelque chose qu'une entreprise peut réellement utiliser.

Andrei Ogiolan18 min read
Lire l'article
Téléchargez facilement des pages Web et des fichiers avec Python et wget
Guides

Téléchargez facilement des pages Web et des fichiers avec Python et wget

Automatisez l'extraction de données sur le Web et le téléchargement de fichiers avec Python et wget. Découvrez comment utiliser ces outils pour collecter des données et gagner du temps.

Gabriel Cioci8 min read
Lire l'article

Commencez à créer

Prêt à faire évoluer votre système de collecte de données ?

Rejoignez plus de 2 000 entreprises qui utilisent WebScrapingAPI pour extraire des données Web à l'échelle de l'entreprise, sans aucun coût d'infrastructure.