La pratique consistant à déployer des robots pour collecter des informations et du contenu à partir d'un site web est connue sous le nom de « web scraping ». Un fournisseur de services de web scraping collecte le code HTML de base et les données stockées sur un serveur, contrairement au « screen scraping », qui extrait les pixels visibles à l'écran. Le scraper peut ensuite reproduire l'intégralité du contenu d'un site web ailleurs.
De nombreuses entreprises numériques qui s'appuient sur la collecte de données ont recours au web scraping. Les sociétés qui mènent des études de marché utilisent des scrapers pour obtenir des informations sur les réseaux sociaux et les forums. Un site web est exploré par des algorithmes de recherche web, qui examinent ensuite ses données et lui attribuent une note.
Les sites de comparaison de prix utilisent des robots pour obtenir les prix et les détails des produits sur les sites des vendeurs affiliés. Le web scraping est également utilisé pour des activités telles que la fixation abusive des prix et le vol de contenu. Un site web victime de scraping peut subir des pertes financières importantes, en particulier s'il s'agit d'une entreprise qui s'appuie sur des méthodes de tarification compétitives ou qui distribue du contenu.
Le vol de contenu à grande échelle sur un site web spécifique est appelé « scraping de contenu ». Les annuaires de produits en ligne et les sites web qui s'appuient sur du contenu numérique pour générer du trafic sont des cibles courantes. Une attaque par scraping de contenu peut être fatale pour ces entreprises.
Par exemple, la création du contenu de leur base de données demande du temps, de l'argent et des efforts aux annuaires d'entreprises locales en ligne. Le scraping peut conduire à ce que tout ce contenu soit rendu public, utilisé à des fins de spam ou vendu à des entreprises concurrentes.




