Comment utiliser le fichier robots.txt pour le SEO
Apprenez à créer, tester et déployer un robots.txt efficace pour contrôler le crawl, protéger des ressources et éviter les erreurs SEO courantes.

Ce que vous apprendrez dans cet article
Cet article explique ce qu'est robots.txt, comment il affecte le crawling et l'indexation, comment écrire des règles correctes, comment tester et déployer le fichier, et quelles erreurs éviter. Vous trouverez des exemples concrets et une checklist de vérification.
Qu'est-ce que robots.txt et à quoi il sert
Le fichier robots.txt est un fichier texte placé à la racine d'un site (ex. https://www.domain.com/robots.txt). Il donne des indications aux robots web — crawlers — sur les parties du site qu'ils sont invités à parcourir ou à éviter. C'est une convention du protocole d'exclusion des robots, utile pour :
- éviter que des ressources volumineuses (ex. exports, backups) grèvent le budget de crawl ;
- prévenir l'exploration de contenus privés ou de pages de staging ;
- indiquer l'emplacement des sitemaps pour faciliter la découverte des URL importantes.
Crawl, indexation et classement : que contrôle robots.txt
Il est important de distinguer trois étapes : crawling (découverte et récupération des pages), indexation (stockage ou rejet d'une page dans l'index) et classement (order dans les résultats). Le fichier robots.txt influence principalement le crawling : il indique aux robots quelles URL ils doivent ou ne doivent pas visiter. Si un robot ne visite pas une page, Google n'aura pas le contenu à évaluer pour l'indexation, donc l'absence de crawl peut conduire à l'absence d'indexation.
Attention : bloquer l'accès au crawling via robots.txt ne garantit pas que l'URL ne sera pas indexée. Google peut connaître l'existence d'une URL via des liens externes et afficher l'URL dans les résultats sans contenu (ou avec un contenu minimal). Pour contrôler explicitement l'indexation d'une page que vous possédez, utilisez plutôt l'entête HTTP noindex ou la balise meta robots sur la page, et assurez-vous que la page est crawlable pour que Google puisse lire l'instruction.
Syntaxe de base et exemples courants
Un robots.txt contient des directives structurées par groupe de user-agents. Les directives les plus communes sont User-agent, Disallow, Allow et Sitemap. Voici un jeu d'exemples et leur usage.
Exemple minimal (autorise tout) :
User-agent: *
Disallow:
Exemple pour bloquer un dossier privé :
User-agent: *
Disallow: /private/
Sitemap: https://www.domain.com/sitemap.xml
Exemple pour autoriser Googlebot mais bloquer d'autres robots :
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /tmp/
Remarques sur les patterns et les wildcards
Le standard autorise l'utilisation de l'astérisque (*) comme wildcard et du dollar ($) pour désigner la fin d'une URL dans certains moteurs. Vérifiez le comportement concret des robots importants pour vos audiences (Google, Bing).
Outils et méthodes pour tester robots.txt et son effet
Voici des vérifications pratiques, du plus direct au plus complet.
- Vérifier le fichier en direct : consultez https://www.domain.com/robots.txt ou http://www.yoursite.com/robots.txt pour voir le contenu servi.
- Utiliser curl pour récupérer le corps et/où les en-têtes :
Récupérer le contenu : curl https://www.domain.com/robots.txt
Vérifier les en-têtes HTTP : curl -I https://www.domain.com/robots.txt
- Tester une URL spécifique côté Google (pour les pages que vous possédez) : utilisez l'outil URL Inspection de Google Search Console afin de voir si Google a accès et quelles instructions ont été prises en compte.
- Vérifier l'indexation publique : l'opérateur site: peut donner une indication si Google affiche des pages d'un domaine, mais ce n'est pas un verdict définitif sur l'indexation.
- Contrôler depuis le navigateur : ouvrez la page bloquée et inspectez l'onglet Réseau / DevTools pour confirmer que la page renvoie bien un 200 et qu'aucune redirection n'empêche l'accès.
Erreurs fréquentes et bonnes pratiques
Voici les erreurs que l'on rencontre régulièrement et comment les éviter.
- Bloquer des pages contenant une instruction noindex : si vous empêchez le crawl d'une page, Google ne peut pas lire sa balise meta robots noindex. Pour retirer une page de l'index, assurez-vous qu'elle est accessible pour que Google lise le noindex.
- Fautes de chemin : attention aux slashs en trop ou manquants. Par exemple, Disallow: /private bloque le chemin commençant par /private, mais une faute de frappe peut laisser le dossier accessible.
- Dépendre uniquement de robots.txt pour protéger des données sensibles : robots.txt est public et indique aux mauvais acteurs où se trouvent les ressources. Ne l'utilisez pas pour masquer des informations confidentielles ; protégez-les avec une authentification ou des règles serveur.
- Confondre Disallow et blocage côté serveur : Disallow empêche le crawl mais n'empêche pas la navigation directe. Pour empêcher l'accès, configurez le serveur (401/403) ou l'authentification.
Checklist de déploiement et vérification
Avant de rendre votre robots.txt public, passez cette checklist :
- Relire toutes les directives et valider les chemins (ajoutez des tests unitaires si votre déploiement automatise la génération).
- Vérifier que les pages qui doivent être indexées ne sont pas bloquées par erreur.
- S'assurer que le fichier est servi depuis la racine (ex. http://www.yoursite.com/robots.txt).
- Après déploiement, utiliser curl et les logs serveur pour vérifier les accès des user-agents principaux et détecter des erreurs 5xx lors de la récupération du robots.txt.
Si vous gérez le site, utilisez Google Search Console pour valider que Googlebot peut accéder au fichier et pour inspecter l'URL d'une page afin de comprendre pourquoi elle n'est pas indexée.
Cas pratiques et exemples d'utilisation
Exemples d'usage courants :
- Empêcher l'exploration de ressources temporaires ou d'exports : Disallow: /downloads/exports/
- Indiquer la position du sitemap : Sitemap: https://www.domain.com/sitemap.xml pour faciliter la découverte des URL importantes.
- Gérer des crawlers tiers : spécifier des règles pour des user-agents précis si nécessaire (ex. User-agent: Bingbot).
Ressources utiles et liens préservés
Consultez directement vos fichiers robots.txt de test ou de production aux adresses suivantes si elles existent : http://www.yoursite.com/robots.txt et https://www.domain.com/robots.txt. Pour des pages de remerciement ou de test mentionnées dans des environnements de démonstration, vous pouvez retrouver des chemins comme http://www.yoursite.com/thankyou, http://www.yoursite.com/thank-you ou http://www.yoursite.com/free-stuff selon votre configuration.
Enfin, n'utilisez pas robots.txt pour « cacher » des données sensibles : préférez des solutions d'authentification ou des contrôles côté serveur (ex. http://www.yoursite.com/private).
Ressource recommandée
Pour approfondir les aspects de technical SEO liés au crawl et à l'indexation, Lisez le guide Technical SEO.
FAQ
Le fichier robots.txt empêche-t-il l'indexation d'une page ?
Pas nécessairement. robots.txt empêche le crawl par les robots qui respectent la norme, mais Google peut toujours indexer une URL si elle est découverte via des liens externes. Pour contrôler l'indexation, utilisez une directive noindex sur la page et assurez-vous que la page est crawlable pour que Google lise cette directive.
Dois‑je ajouter l'emplacement de mon sitemap dans robots.txt ?
Oui. Ajouter une ligne Sitemap: https://www.domain.com/sitemap.xml aide les moteurs à trouver votre sitemap. C'est une bonne pratique complémentaire au dépôt du sitemap dans Google Search Console.
Comment tester si une règle bloque réellement Googlebot ?
Pour votre propre domaine, utilisez URL Inspection dans Google Search Console pour vérifier si Google voit la page et quelles directives ont été prises en compte. Complétez par curl et l'examen des logs serveur pour confirmer les accès de Googlebot.
Puis‑je utiliser robots.txt pour empêcher le scraping malveillant ?
Non. robots.txt est public et indique publiquement où les administrateurs demandent aux robots de ne pas aller. Les acteurs malveillants peuvent ignorer ces instructions. Protégez les données sensibles via l'authentification, les règles serveur et des contrôles d'accès.
Articles associés

Checklist SEO on-page pour améliorer classements et UX
Checklist actionable pour optimiser le SEO on-page : performance, contenu, balises techniques, mobile-first et vérifications concrètes.

Conseils SEO pour booster votre classement
Stratégies SEO concrètes et actuelles : technique, contenu, netlinking et vérifications pour améliorer la visibilité de votre site en 2026.

Balises H1 — bonnes pratiques SEO
Comprendre le rôle des balises H1, appliquer des règles simples de structure et vérifier leur rendu pour maximiser la clarté sémantique et l'accessibilité.

Étapes pour construire un pipeline de trafic organique
Un guide opérationnel pour concevoir, exécuter et vérifier un pipeline de trafic organique durable, avec checklists et erreurs à éviter.

Schéma FAQ : bases, implémentation et vérification
Comprenez le Schéma FAQ, apprenez à l'implémenter en JSON‑LD, à le tester avec les outils actuels et à éviter les erreurs qui réduisent son efficacité.
