En bref : GoSpider est un robot d’exploration en ligne de commande destiné à découvrir des URL, et non un outil complet de collecte de données structurées. Ce guide d’utilisation de GoSpider présente une exploration délimitée, une gestion propre des résultats, un transfert de Colly vers un fichier CSV, ainsi qu’une procédure de diagnostic pour les réponses 403 ou les pages nécessitant un rendu JavaScript.
Le crawling Web consiste à découvrir et à parcourir automatiquement des pages Web via leurs liens. GoSpider est un robot d’exploration en ligne de commande basé sur Go qui cartographie rapidement les URL, tandis qu’un extracteur tel que Colly visite les pages sélectionnées et extrait des champs dans un schéma exploitable.
Si vous avez recherché « Comment utiliser GoSpider », la distinction la plus importante réside dans le point de transfert : GoSpider construit l’ensemble des URL candidates, puis votre code de nettoyage et d’extraction décide de ce qui deviendra des données. Cette séparation permet de maintenir une découverte suffisamment large pour trouver des pages utiles sans la mélanger avec des sélecteurs, la validation des enregistrements ou l’écriture au format CSV.
Ce tutoriel commence par un petit site de test public, explique les commandes GoSpider qui contrôlent la portée et la charge, puis transforme le résultat en un pipeline Go reproductible. Il traite également les indicateurs et les valeurs par défaut comme étant spécifiques à chaque version. Avant d’exécuter une recette, comparez-la avec gospider -h et le dépôt officiel de GoSpider, car les alias et le comportement peuvent changer d’une version à l’autre.




