Skip to content

Comment utiliser le fichier Robots.txt pour le SEO

Apprends à utiliser le fichier robots.txt pour le SEO. Contrôle le crawl des moteurs de recherche, améliore l'indexation et protège les pages privées avec une configuration robots.txt adéquate.

How to Use Robots.txt File for SEO

Savais-tu que Robots.txt est l'un des éléments clés du SEO de ton site ? Qu'est-ce que Robots.txt exactement, et comment l'utiliser pour le SEO ? Nous allons t'expliquer tout cela dans cet article.

Qu'est-ce que Robots.txt ?

Il existe des fichiers dans le répertoire racine d'un site web qui indiquent aux moteurs de recherche crawlers et spiders quelles pages et quels fichiers ils doivent voir et lesquels ils ne doivent pas voir. Les administrateurs web veulent souvent que leurs sites soient trouvés par les moteurs de recherche, mais il y a des moments où ce n'est pas nécessaire. Si tu conserves des informations privées ou si tu essaies d'économiser de l'espace, tu peux empêcher les moteurs de recherche d'indexer tes fichiers (à l'exclusion des pages lourdes avec des images).

Le standard d'exclusion des robots, également connu sous le nom de protocole d'exclusion des robots ou simplement robots.txt, est un standard utilisé par les sites webpour communiquer avec les web crawlers et autres web robots.

Les robots sont souvent utilisés par les moteurs de recherche pour catégoriser les sites web. Tous les robots ne coopèrent pas avec le standard ; les récolteurs d'e-mails, les spambots, les malwares et les robots qui recherchent des vulnérabilités de sécurité peuvent même commencer par les parties du site web où on leur a dit de ne pas aller. Le standard peut être utilisé conjointement avec les Sitemaps, un standard d'inclusion de robots pour les sites web. – Wikipédia

Les moteurs de recherche qui utilisent des mots-clés et des métadonnées pour indexer les pages web affichent les résultats les plus pertinents aux personnes qui recherchent quelque chose sur Internet. Il est plus important pour les propriétaires de boutiques en ligne d' obtenir de bons résultats de moteur de recherche que pour toute autre entreprise. Généralement, les gens ne dépassent pas les premières pages de résultats des suggestions d'un moteur de recherche .

L'indexation est effectuée à l'aide de spiders ou de crawlers, qui se déplacent. C'est ainsi que les moteurs de recherche obtiennent et organisent toutes les informations sur Internet. Ces entreprises utilisent ces bots.

How to Use Robots.txt File for SEO

robots.txt est le fichier que les crawlers recherchent lorsqu'ils visitent un site web pour la première fois. Dès que le crawler trouve un fichier comme celui-ci, il y cherchera des instructions sur la façon d'indexer le site. Il n'y a pas d'instructions pour le bot qui ne les trouve pas, il utilise donc l' algorithme de son fonctionnement pour les rechercher. Cela entraîne de nombreuses recherches sur le site web, mais rend également le processus d'indexation moins efficace.

Pour que le fichier robots.txt fonctionne, il ne peut y en avoir qu'un seul sur le site. Un nom de domaine additionnel doit avoir un fichier robots.txt à la racine de sa page web. Par exemple, il devrait être à https://www.domain.com/robots.txt, et il devrait indiquer aux robots de ne pas aller sur ce site.

Il est également important de s'assurer que le nom de ton fichier est bien robots.txt. Si le nom n'est pas correctement orthographié, cela ne fonctionnera pas.

Prends le contrôle

Tu as plus de contrôle sur le SEO de ton site que tu ne le penses.

En général, c'est vrai. Tu peux choisir quels crawlers et indexeurs peuvent voir et indexer ton site au niveau de la page. Il existe un fichier appelé robots.txt qui peut être utilisé pour s'assurer que cela ne se reproduise pas. Il y a un simple fichier texte appelé robots.txt dans le répertoire racine de ton site web. Ce fichier indique aux robots web de ne pas lire ton site web. Les robots peuvent utiliser ces informations pour améliorer leurs résultats de recherche pour être plus spécifiques.

Parce que ce n'est pas la panacée, tu as découvert que c'est un excellent moyen de faire en sorte que ton site web soit vu par les moteurs de recherche. Si tu veux que les moteurs de recherche aiment ton site, tu dois faire une bonne première impression. Utilisé correctement, robots.txt peut aider au SEO.

Alors, comment t'y prendre ? Quel est son but ? Que ne devrais-tu jamais faire ? Les réponses à ces questions se trouvent à la page suivante.

La raison d'utiliser Robots.txt

Robots.txt est un fichier que les moteurs de recherche utilisent pour déterminer quelles pages de ton site indexer et lesquelles exclure des résultats de recherche. Par exemple, si tu indiques dans ton fichier Robots.txt que ta page de remerciement ne doit pas être disponible pour les moteurs de recherche, cette page n'apparaîtra pas dans les résultats de recherche et ne sera pas accessible aux personnes qui la recherchent sur le web. Certaines pages de ton site doivent être cachées aux moteurs de recherche pour des raisons de confidentialité et de ranking. C'est important pour les deux.

Où trouver ton fichier Robots ?

Get in control

Si tu as un site web, le fichier robots.txt se trouve dans le répertoire racine de ton site. Accède à ton cPanel FTP et cherche-le dans la zone HTML publique de ton compte. Ces fichiers ne prennent pas beaucoup de place. Ils ne font peut-être que quelques centaines d'octets. Si tu n'en trouves pas, tu devras en créer un.

Comment fonctionne Robots.txt

Lorsque les moteurs de recherche souhaitent indexer ton site, ils envoient de petits programmes appelés « spiders » ou « robots » qui explorent ton site et renvoient des données aux moteurs de recherche. Les directives « Disallow » de Robots.txt indiquent aux moteurs de recherche et autres programmes de ne pas rechercher certaines pages de ton site web que tu spécifies dans la commande. Les commandes suivantes peuvent être trouvées dans le fichier robots.txt :

empêchera tous les robots des moteurs de recherche d'accéder à la page suivante de ton site : http://www.yoursite.com/thankyou

Avant la commande disallow se trouve la commande : « User-agent: * », La partie User-agent identifie le robot que tu souhaites interdire.

« User-agent: Googlebot ». Cette commande empêcherait uniquement les robots de Google d'accéder au site web ; les autres pourraient toujours y accéder : http://www.yoursite.com/thankyou

Cependant, en utilisant le caractère « * », tu spécifies que les commandes ci-dessous s'appliquent à tous les robots. Ton fichier robots.txt se trouverait dans le répertoire principal de ton site. Par exemple : http://www.yoursite.com/robots.txt

Comment créer un fichier Robots.txt

How to Put Together a Robots.txt File

N'importe qui peut créer ce fichier texte simple. Tu as besoin d'un éditeur de texte comme le Bloc-notes pour écrire ton texte. Ouvre un nouveau fichier texte et enregistre-le sous « robots.txt », puis saisis-y du texte. Lorsque tu es dans ton cPanel, va dans le dossier HTML public et clique dessus. Commence par t'assurer que le fichier est déjà là.

Si tout semble bon, tu as terminé. Seule la personne qui possède le fichier devrait pouvoir le voir et le modifier. Pour que le fichier fonctionne, il doit avoir la permission « 0644 ».

Si ce n'est pas le cas, fais un clic droit sur le fichier et choisis « modifier les permissions ». Et voilà ! Il existe un fichier appelé robots.txt qui contient des instructions pour les robots. Syntaxe de Robots.txt. Le fichier robots.txt comporte plusieurs sections de « directives » pour chaque user agent qui a été configuré. Chacune commence par le nom du user agent. Chaque bot de crawl est identifié par son ID de user agent selon le code.

Il y a deux façons de procéder : Tant que tu utilises un caractère générique, tu peux cibler tous les moteurs de recherche simultanément. Tu peux choisir les moteurs de recherche que tu souhaites cibler. Lorsque tu lances un bot de crawling, il se dirigera vers les parties du site web qui lui sont spécifiquement indiquées. Il procédera comme suit :

Directive User-Agent

Les premières lignes de chaque bloc incluent le user-agent, qui identifie un bot. Ainsi, par exemple : si tu veux indiquer à un Googlebot ce qu'il doit faire, tu commencerais par :

User-agent: Googlebot En règle générale, les moteurs de recherche recherchent les informations les plus pertinentes.

Tant que tu as une directive Googlebot-Video et une directive Bingbot en place. Le user agent « Bingbot » agira comme indiqué. Tu peux t'attendre à des instructions plus précises de la part de Googlebot-Video.

Ci-dessous sont listés les robots de moteurs de recherche les plus utilisés.

Directive Disallow

Les bots ne pourront pas accéder à certaines parties de ton site si tu actives cette fonctionnalité. Rien n'empêche les bots de parcourir Internet et d'accéder à tous les sites web qu'ils souhaitent.

Directive Sitemap (Sitemaps XML)

Cette balise meta indique aux moteurs de recherche où se trouve ton sitemap. Tu dois les envoyer à la Google Search Console des moteurs de recherche pour qu'ils soient trouvés. Il serait utile que tu utilises chacun de ces outils car ils pourraient t'apprendre beaucoup sur ton site web.

Lorsque la vitesse est importante, utilise la directive appelée « sitemap ».

Directive Crawl-Delay

Si tu veux ralentir un peu Yahoo, Bing et Yandex lors de leur crawl, tu peux insérer une directive appelée « crawl-delay ». Voici ce qui se passera lorsque tu inséreras cette ligne dans ton bloc :

Crawl-Delay:10 Attends dix secondes avant de crawler.

Lorsqu'un moteur de recherche est configuré, il peut être réglé pour attendre dix secondes avant de crawler un site ou dix secondes avant de revenir sur un site après un crawl. L'effet est presque le même mais légèrement différent selon le moteur de recherche utilisé. Après un crawl, un Crawl-delay de 1 signifie que les moteurs de recherche commenceront à crawler le site immédiatement.

Utiliser Google Search Console pour créer Robots.txt

Sélectionne « crawler access » dans la barre de menu pour créer rapidement un fichier robots.txt avec un compte Google Search Console gratuit. Pour créer un fichier Robots.txt de base, choisis « générer robots.txt » lorsque tu arrives sur le site.

Sous « action », choisis « bloquer », et sous « User-agent », choisis les robots que tu ne veux pas voir sur ton site web. Choisis « répertoires et fichiers » et saisis les noms des dossiers que tu veux garder hors de portée. « http://www.yoursite.com » ne doit en aucun cas faire partie de cette stratégie. Par exemple, si tu ne veux pas que les gens puissent voir les pages ci-dessous, tu peux :

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

Dans Google Search Console, saisis ce qui suit dans le champ « répertoires et fichiers » :/thank-you

  • /free-stuff
  • /private

Après avoir saisi ces éléments pour tous les robots et cliqué sur « ajouter une règle », le fichier Robots.txt final ressemblerait à ceci.

Après avoir saisi ces éléments pour tous les robots et cliqué sur « ajouter une règle », le fichier Robots.txt final ressemblerait à ceci.

Il existe une commande « Allow » par défaut si tu veux faire une exception et autoriser un robot à accéder à un site web que tu as bloqué avec une commande.

Using Google Webmaster Tools to create Robots.txt

Le Googlebot ne peut accéder au répertoire des photos de ton site que si la commande d'interdiction est placée à côté. Ensuite, clique sur « télécharger » pour obtenir ton fichier Robots.txt. Clique sur « télécharger » lorsque tu as choisi les pages et les fichiers que tu veux bloquer, clique sur « télécharger ».

Installe ton fichier Robots.txt

Un fichier appelé « Robots.txt » peut maintenant être ajouté au répertoire principal (www) de la zone CNC de ton site web. Cela signifie qu'il peut maintenant être trouvé. Filezilla est un bon client FTP pour cela. Fais créer ton fichier robots.txt par un programmeur web après lui avoir donné une liste d'URL qui devraient être bloquées du crawl. C'est une option supplémentaire. Dans ce cas, un développeur web qualifié terminera le travail en moins d'une heure.

Noindex vs. Disallow

Beaucoup de gens ne savent pas quelle règle utiliser dans le fichier robots.txt de ton site web dans la barre de navigation. C'est parce que les raisons données dans la section précédente font que les règles de non-indexation de Robots.txt ne fonctionnent plus.

Ton site web peut avoir une balise meta « noindex » que tu peux utiliser pour empêcher les moteurs de recherche d'indexer l'une de tes pages web. En règle générale, cette balise permettra aux robots web de visiter ton site, mais elle indiquera également aux moteurs de recherche de ne pas indexer ta page.

Elle pourrait ne pas être aussi efficace que la balise noindex à long terme. La règle disallow pourrait ne pas être aussi efficace que cette balise. C'est bien parce que robots.txt empêche les moteurs de recherche de scanner ta page. Cela ne les empêche pas d'indexer ta page en se basant sur des informations provenant d'autres pages et sites web, ce qui est bien.

Il est important de se rappeler que même si tu désactives et ajoutes une balise noindex à une page, les robots ne connaîtront pas la balise et peuvent continuer à indexer la page même si tu le fais.

Mistakes you will want to avoid

Erreurs à éviter

Tu as appris les nombreuses choses que tu peux faire avec ton fichier robots.txt et comment l'utiliser. Dans cette partie, nous allons examiner chaque problème plus en détail et montrer comment, s'il est mal utilisé, cela pourrait avoir un mauvais effet sur le SEO.

Tu ne peux pas utiliser un fichier robots.txt ou une balise « noindex » pour empêcher les gens d'accéder à des informations utiles que tu souhaites rendre publiques. Par le passé, nous avons vu de nombreuses choses de ce genre se produire avec le SEO. Toutes ont eu un mauvais effet sur les résultats. Il est important de s'assurer que toutes tes pages web ont des balises et des règles noindex et noblock avant leur mise en ligne.

Si tu utilises des directives crawl-delay, tu ne devrais pas les utiliser trop souvent. C'est parce qu'elles limitent le nombre de pages que les bots peuvent consulter. D'autre part, avoir un grand site web peut rendre plus difficile pour toi d'obtenir des rankings élevés et d'obtenir beaucoup de visiteurs.

Pour t'assurer que le fichier de ton robot est lu correctement, tu dois utiliser le format Robots.txt correct pour ton fichier. Toutes les lettres doivent être en minuscules lorsqu'il se trouve dans le fichier du robot. Il doit être appelé « robots.txt ». Il ne peut pas fonctionner si ce n'est pas le cas.

Conclusion – Teste ton Robots.TXT

Ton fichier doit maintenant être vérifié pour s'assurer qu'il fonctionne correctement. Il existe une boîte de test robots.txt que tu peux utiliser dans Google Search Console, mais seulement si tu utilisais l'ancienne Google Search Console, qui n'est plus utilisée. Le testeur robots.txt ne fonctionne plus en raison de la GSC la plus récente (Google travaille d'arrache-pied pour ajouter de nouvelles fonctionnalités à la GSC, alors peut-être qu'à l'avenir, nous pourrons voir le testeur Robots.txt dans la navigation principale).

Si tu veux en savoir plus sur ce que le testeur Robots.txt peut faire, va sur la page d'aide de Google. Un autre outil utile existe :

Choisis un projet dans le menu déroulant de droite. Par exemple, tu peux travailler sur le site web de ton entreprise ou un autre projet.

Pour remplacer l'ancien fichier robots.txt par celui que tu viens de créer, tu dois d'abord tout retirer de la boîte. Pour lancer un test, clique sur « Tester ».

La valeur de « Test » doit être modifiée en « Autorisé ». Cela garantira que ton fichier robots.txt fonctionne correctement.

En t'assurant que ton fichier robots.txt est correct, tu peux améliorer les performances de ton moteur de recherche et l' expérience utilisateur de tes visiteurs en même temps. Il t'est plus facile de contrôler ce que les gens voient lorsqu'ils recherchent des choses sur ton site si les robots peuvent passer leurs journées à le consulter et à l'indexer.

Questions fréquemment posées

Articles associés

Comment utiliser le fichier Robots.txt pour le SEO · BlogDrip