Aller au contenu
Parlons de votre projet
SEO

Robots.txt : à quoi sert ce fichier vraiment ?

À quoi sert le fichier robots.txt, comment l’écrire sur WordPress et les erreurs qui font disparaître des pages de Google : le guide simple, avec exemple.

Un lundi matin, votre site a disparu de Google. Aucune panne, aucune pénalité : une seule ligne de texte, oubliée dans un petit fichier après une refonte, interdit à tous les robots d’explorer vos pages. Ce scénario n’a rien d’exceptionnel, et il coûte des semaines de visibilité avant qu’on ne pense à regarder le fichier robots.txt.

À l’inverse, beaucoup de sites s’en servent pour « cacher » des pages, ce qu’il ne sait pas faire. Voici à quoi il sert vraiment, comment l’écrire, et surtout comment éviter les deux erreurs les plus courantes.

À quoi sert le fichier robots.txt ?

Le fichier robots.txt est un simple fichier texte placé à la racine de votre site (par exemple votresite.fr/robots.txt). Avant d’explorer vos pages, les robots des moteurs de recherche le consultent pour savoir où ils sont invités à aller… ou non. Il sert à trois choses :

  • Orienter l’exploration : écarter les zones sans intérêt pour la recherche (administration, résultats de recherche interne, filtres à l’infini) afin que les robots consacrent leur temps à vos pages utiles.
  • Ménager votre serveur : limiter les passages inutiles sur les grands sites.
  • Indiquer votre sitemap : une ligne suffit pour donner l’adresse de votre plan de site aux robots.

Retenez la nuance : le robots.txt est une demande adressée aux robots respectueux des règles, pas un verrou. Google et les grands moteurs s’y conforment ; un robot malveillant peut l’ignorer.

robots.txt, noindex ou mot de passe : ne pas les confondre

C’est l’erreur numéro un. Bloquer une page dans le robots.txt empêche Google de la lire, mais pas forcément de la lister : si d’autres sites pointent vers elle, elle peut apparaître dans les résultats, sans description. Chaque outil répond à un besoin différent.

Comparatif

Quel outil pour quel besoin ?

Outil Ce qu’il fait Ce qu’il ne fait pas Quand l’utiliser
robots.txt Demande aux robots de ne pas explorer une adresse ou un dossier N’empêche pas l’affichage d’une adresse citée ailleurs ; ne protège rien Économiser l’exploration : administration, recherche interne, filtres
Balise noindex Demande à Google de ne pas afficher la page dans ses résultats Ne fonctionne pas si la page est bloquée par le robots.txt : le robot ne peut pas la lire Pages utiles aux visiteurs mais sans intérêt en recherche : remerciement, doublons
Mot de passe Bloque l’accès aux visiteurs comme aux robots Rien : c’est la seule vraie barrière Préproduction, espaces privés, données sensibles

Comment lire et écrire un fichier robots.txt

Le fichier repose sur quelques commandes seulement :

  • User-agent : désigne le robot visé. L’astérisque (*) vise tous les robots, Googlebot vise celui de Google.
  • Disallow : interdit l’exploration d’une adresse ou d’un dossier.
  • Allow : autorise une exception à l’intérieur d’un dossier interdit.
  • Sitemap : donne l’adresse complète de votre plan de site.

Google comprend aussi deux caractères spéciaux : * remplace n’importe quelle suite de caractères et $ marque la fin d’une adresse. Un exemple typique pour un site WordPress :

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=

Sitemap: https://www.votresite.fr/sitemap_index.xml

Ici, tous les robots sont invités à éviter l’administration (sauf le fichier nécessaire au fonctionnement de certaines fonctions) et les pages de résultats de recherche interne, et le sitemap est indiqué. Le fichier est sensible à la casse et vaut uniquement pour le domaine où il se trouve : un sous-domaine a son propre fichier.

Les 5 erreurs qui font disparaître des pages

  1. Laisser Disallow: / après la mise en ligne. Cette ligne interdit tout le site. Elle est parfois posée sur un site en construction, puis oubliée au lancement. Relisez le fichier le jour de la mise en ligne.
  2. Bloquer les fichiers CSS et JavaScript. Google a besoin de les charger pour afficher vos pages comme un visiteur. Les interdire fausse son analyse.
  3. Utiliser le robots.txt pour désindexer. Pour retirer une page des résultats, laissez-la explorable et ajoutez-lui la balise noindex. Bloquer l’exploration empêche Google de lire cette consigne.
  4. Croire qu’il protège des informations sensibles. Le fichier est public : n’importe qui peut le lire, et il dévoile même les dossiers que vous cherchez à écarter.
  5. Compter sur Crawl-delay pour Google. Cette commande est ignorée par Google : elle ne règle rien pour son robot.

Comment contrôler votre fichier

Commencez par l’afficher : ajoutez /robots.txt à l’adresse de votre site dans le navigateur. Ensuite, la Google Search Console propose un rapport dédié au robots.txt dans ses paramètres : il indique quelle version Google a lue et signale les erreurs. Son rapport d’indexation affiche aussi les pages « Bloquées par le fichier robots.txt » : vérifiez que ce sont bien celles que vous vouliez bloquer. Pour les autres motifs d’exclusion, voyez pourquoi Google n’indexe pas certaines pages.

Et les robots des intelligences artificielles ?

Les robots de certains assistants IA, comme GPTBot d’OpenAI, déclarent respecter le robots.txt. Vous pouvez donc décider de les autoriser ou de les refuser. Attention à l’arbitrage : refuser ces robots protège vos contenus d’un usage que vous n’avez pas choisi, mais peut aussi réduire vos chances d’être cité dans leurs réponses. Cette décision relève de votre stratégie de visibilité, notre approche GEO l’aborde au cas par cas.

Sur WordPress : où trouver le fichier ?

Si aucun fichier physique n’existe, WordPress génère un robots.txt « virtuel » avec des règles de base. Pour le modifier sans passer par le serveur, l’éditeur de fichiers de Yoast SEO (menu Outils) permet de le créer et de le changer depuis l’administration. Après toute modification, revérifiez l’adresse /robots.txt et testez une page importante avec l’Inspection d’URL. Cette vérification fait partie de tout bon audit technique, et de notre accompagnement SEO.

À lire aussi : pour comprendre ce que Google fait des pages en double, voir le contenu dupliqué : risques réels et solutions.

Questions fréquentes

Vos questions sur le fichier robots.txt

C’est quoi le robots.txt ?

C’est un fichier texte placé à la racine d’un site qui indique aux robots des moteurs de recherche les pages ou dossiers qu’ils peuvent explorer ou non. Il oriente l’exploration, mais ne protège pas les contenus.

Comment trouver le robots.txt d’un site ?

Ajoutez /robots.txt à la fin de l’adresse du site, par exemple votresite.fr/robots.txt. Le fichier est public et s’affiche directement dans le navigateur.

C’est quoi Googlebot ?

Googlebot est le robot d’exploration de Google. Il parcourt les pages web pour les découvrir et les analyser avant qu’elles ne soient éventuellement indexées.

Comment utiliser le fichier robots.txt de WordPress ?

WordPress génère un fichier virtuel par défaut. Pour le personnaliser, créez-le via un plugin SEO comme Yoast SEO ou déposez un fichier robots.txt à la racine du site, puis vérifiez le résultat sur /robots.txt.

Un fichier robots.txt est-il obligatoire ?

Non. Sans fichier, les robots explorent tout ce qu’ils trouvent. Il devient utile dès que vous voulez écarter des zones sans intérêt pour la recherche ou signaler votre sitemap.

Écrit par

L’équipe Agent du WEB

Agence web 100 % à distance : plus de 10 sites créés et plus de 30 accompagnements SEO & GEO menés pour des TPE, PME et indépendants.

Découvrir l’agence · Notre page « SEO »

À lire aussi

Autres guides SEO

Newsletter d’entreprise : la rendre utile

Promesse, rythme, format, collecte conforme et indicateurs : construire une newsletter d'entreprise que vos clients…

Lire plus

Paramètres UTM : tracer toutes vos campagnes

Les cinq paramètres UTM, une convention de nommage simple, des cas d'usage et les erreurs…

Lire plus

Tableau de bord marketing : cinq indicateurs

Trafic qualifié, demandes, coût par demande, taux de transformation et chiffre d'affaires généré : cinq…

Lire plus

Un doute sur les réglages techniques de votre site ?

Demandez un audit gratuit : nous vérifions l’exploration et l’indexation de vos pages et vous indiquons les priorités.

Demander mon audit gratuit