2016
17/Jan

Google scraping : Définition

Définition : Google scraping

Le terme Google Scraping dĂ©signe le procĂ©dĂ© qui consiste Ă  effectuer plusieurs requĂȘtes automatiques sur Google ou l’un de ses services. Cette pratique est surtout utilisĂ©e dans un but d’analyse et de rĂ©fĂ©rencement.

 

Des requĂȘtes automatisĂ©es

Le Google Scraping se dĂ©finit comme le fait de gĂ©nĂ©rer de gros volumes de requĂȘtes automatisĂ©es. Cette pratique est obtenue Ă  l’aide d’un logiciel, d’un script, d’un programme conçu par un webmestre ou directement depuis les interfaces de programmation de Google.

GrĂące au Google Scraping, il est possible de rĂ©colter des donnĂ©es statistiques sur les requĂȘtes, mais Ă©galement de repĂ©rer les sites en Do Follow, les liens externes ou encore de suivre le positionnement des mots clĂ©s.

Analyser pour mieux référencer

La pratique du scraping sur Google est surtout utile dans le domaine du SEO et du rĂ©fĂ©rencement en gĂ©nĂ©ral. Il est utilisĂ© pour analyser diffĂ©rents Ă©lĂ©ments pouvant ĂȘtre utiles au rĂ©fĂ©rencement d’un site.

​Pourquoi adopter le Google scraping ?

Le Google Scraping est une technique utilisĂ©e par les personnes ou les entreprises qui utilisent une vaste quantitĂ© de donnĂ©es disponibles sur le web afin de prendre des dĂ©cisions plus intelligentes. Par l’intermĂ©diaire de programmes, de logiciel automatique ou autre site, son objectif sera de rĂ©cupĂ©rer et restructurer les donnĂ©es d’une page.

​RĂ©utilisation des contenus

Le Google scraping ou Google harvesting consiste Ă  rĂ©utiliser les contenus d’un site pour le publier sur une autre plateforme. Cela permet de multiplier le nombre de pages d’un mĂȘme texte et d’obtenir par la mĂȘme occasion un meilleur rĂ©fĂ©rencement naturel. Il sert Ă©galement Ă  alimenter les donnĂ©es de n’importe quel type d’application ou site web pour le rendre fonctionnel. Mais ce pompage ou pillage de contenu est pĂ©nalisĂ© par Google si les algorithmes des moteurs de recherches arrivent Ă  dĂ©tecter le duplicate content.

​Outil de surveillance des concurrents

Ce processus est Ă©galement requis Ă  des fins de veille concurrentielle. Effectivement, le regroupement de plusieurs informations spĂ©cifiques aide les entreprises dans leur analyse et leur traitement d’informations.

Le Google scraping facilite aussi la comparaison des prix par rapport Ă  ceux des concurrents et cela grĂące aux informations spĂ©cifiques et Ă  la consultation des produits et tarifs d’un site de commerce opposant en ligne. Il facilite par la mĂȘme occasion la gĂ©nĂ©ration de lead et l’étude de marchĂ©.

​Le fonctionnement du Google scraping

Le Google Scraping joue sur le trafic et le positionnement des rĂ©sultats sur le moteur de recherche. C’est pour cela qu’il est important de bien connaĂźtre son fonctionnement.

​Le scraping manuel

Le scraping manuel consiste Ă  copier et insĂ©rer dans une manuelle les donnĂ©es et les informations. C’est un processus qui marche trĂšs bien si les quantitĂ©s des donnĂ©es Ă  exploiter sont assez moindres. Son fonctionnement consiste Ă  repĂ©rer les textes qui vous sont utiles et les enregistrer de façon irrĂ©guliĂšre.

​Le scraping automatique

Cette technique recourt Ă  un logiciel ou Ă  un algorithme afin d’analyser plusieurs sites internet et d’en extraire les informations. Le choix du systĂšme pour le scraping automatique doit avant tout dĂ©pendre du contenu et aussi de la nature du site web. Ce processus se divise sous diffĂ©rentes mĂ©thodes :

  • Les analyseurs syntaxiques : ils convertissent le texte en nouvelle structure. Cette mĂ©thode peut se baser soit sur l’analyse du HTML soit sur l’analyse d’un DOM.

  • Des robots : c’est un logiciel qui exĂ©cute des tĂąches spĂ©cifiques Ă  travers l’automatisation, l’exploration des sites et la collecte des donnĂ©es ;

  • Le texte : cette mĂ©thode est la plus simple, car elle se fait sur la Command Line par le biais des instructions d’Unix grep. Mais elle est Ă©galement la plus longue avec l’exploration web et la recherche des thermes dans Perl ou Python.

​Quelles sont les techniques pour bloquer le Google Scraping ?

Le Google Scraping est lĂ©gal aux États-Unis, en Europe et en France quand les donnĂ©es sont accessibles librement par les utilisateurs. Mais certains scrapeurs passent par la dĂ©naturation des contenus. C’est pourquoi nombreux sont les sites qui emploient diffĂ©rentes techniques pour bloquer ce processus.

​Le fichier robots.txt

Le fichier robots.txt a pour but de bloquer les robots des moteurs de recherche et empĂȘche par la mĂȘme occasion le scraping automatique.

​Les donnĂ©es sous forme d’image ou CSS

Cette technique complique la rĂ©alisation du harvesting dans son site. Son fonctionnement joue sur la transformation des donnĂ©es sous forme d’images ou de feuilles de style CSS. Cela inclut les numĂ©ros de tĂ©lĂ©phone et toutes les coordonnĂ©es sensibles.

Pour aller plus loin, nous vous invitons Ă  dĂ©couvrir notre agence SEO et Ă  tĂ©lĂ©charger notre livre blanc « Placez le Search Engine Marketing au cƓur de votre StratĂ©gie d’Acquisition »

Gabriel Dabi-Schwebel

Posté par

IngĂ©nieur de formation j’ai commencĂ© ma carriĂšre dans le conseil en tĂ©lĂ©com et en mĂ©dia. J’ai aus

Gabriel Dabi-Schwebel

Contact SEO :

Gabriel Dabi-Schwebel

gds@1min30.com
06 73 55 17 36





Commenter

Laisser un commentaire

Votre adresse de messagerie ne sera pas publiée.

Dépassez les objectifs de votre investissement HubSpot !
Rejoignez notre communauté et donnez-vous les moyens de réussir