Newsletter d’entreprise : la rendre utile
Promesse, rythme, format, collecte conforme et indicateurs : construire une newsletter d'entreprise que vos clients…
Lire plusÀ quoi sert le fichier robots.txt, comment l’écrire sur WordPress et les erreurs qui font disparaître des pages de Google : le guide simple, avec exemple.
Un lundi matin, votre site a disparu de Google. Aucune panne, aucune pénalité : une seule ligne de texte, oubliée dans un petit fichier après une refonte, interdit à tous les robots d’explorer vos pages. Ce scénario n’a rien d’exceptionnel, et il coûte des semaines de visibilité avant qu’on ne pense à regarder le fichier robots.txt.
À l’inverse, beaucoup de sites s’en servent pour « cacher » des pages, ce qu’il ne sait pas faire. Voici à quoi il sert vraiment, comment l’écrire, et surtout comment éviter les deux erreurs les plus courantes.
Le fichier robots.txt est un simple fichier texte placé à la racine de votre site (par exemple votresite.fr/robots.txt). Avant d’explorer vos pages, les robots des moteurs de recherche le consultent pour savoir où ils sont invités à aller… ou non. Il sert à trois choses :
Retenez la nuance : le robots.txt est une demande adressée aux robots respectueux des règles, pas un verrou. Google et les grands moteurs s’y conforment ; un robot malveillant peut l’ignorer.
C’est l’erreur numéro un. Bloquer une page dans le robots.txt empêche Google de la lire, mais pas forcément de la lister : si d’autres sites pointent vers elle, elle peut apparaître dans les résultats, sans description. Chaque outil répond à un besoin différent.
| Outil | Ce qu’il fait | Ce qu’il ne fait pas | Quand l’utiliser |
|---|---|---|---|
| robots.txt | Demande aux robots de ne pas explorer une adresse ou un dossier | N’empêche pas l’affichage d’une adresse citée ailleurs ; ne protège rien | Économiser l’exploration : administration, recherche interne, filtres |
| Balise noindex | Demande à Google de ne pas afficher la page dans ses résultats | Ne fonctionne pas si la page est bloquée par le robots.txt : le robot ne peut pas la lire | Pages utiles aux visiteurs mais sans intérêt en recherche : remerciement, doublons |
| Mot de passe | Bloque l’accès aux visiteurs comme aux robots | Rien : c’est la seule vraie barrière | Préproduction, espaces privés, données sensibles |
Le fichier repose sur quelques commandes seulement :
*) vise tous les robots, Googlebot vise celui de Google.Google comprend aussi deux caractères spéciaux : * remplace n’importe quelle suite de caractères et $ marque la fin d’une adresse. Un exemple typique pour un site WordPress :
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Sitemap: https://www.votresite.fr/sitemap_index.xml
Ici, tous les robots sont invités à éviter l’administration (sauf le fichier nécessaire au fonctionnement de certaines fonctions) et les pages de résultats de recherche interne, et le sitemap est indiqué. Le fichier est sensible à la casse et vaut uniquement pour le domaine où il se trouve : un sous-domaine a son propre fichier.
Disallow: / après la mise en ligne. Cette ligne interdit tout le site. Elle est parfois posée sur un site en construction, puis oubliée au lancement. Relisez le fichier le jour de la mise en ligne.noindex. Bloquer l’exploration empêche Google de lire cette consigne.Crawl-delay pour Google. Cette commande est ignorée par Google : elle ne règle rien pour son robot.Commencez par l’afficher : ajoutez /robots.txt à l’adresse de votre site dans le navigateur. Ensuite, la Google Search Console propose un rapport dédié au robots.txt dans ses paramètres : il indique quelle version Google a lue et signale les erreurs. Son rapport d’indexation affiche aussi les pages « Bloquées par le fichier robots.txt » : vérifiez que ce sont bien celles que vous vouliez bloquer. Pour les autres motifs d’exclusion, voyez pourquoi Google n’indexe pas certaines pages.
Les robots de certains assistants IA, comme GPTBot d’OpenAI, déclarent respecter le robots.txt. Vous pouvez donc décider de les autoriser ou de les refuser. Attention à l’arbitrage : refuser ces robots protège vos contenus d’un usage que vous n’avez pas choisi, mais peut aussi réduire vos chances d’être cité dans leurs réponses. Cette décision relève de votre stratégie de visibilité, notre approche GEO l’aborde au cas par cas.
Si aucun fichier physique n’existe, WordPress génère un robots.txt « virtuel » avec des règles de base. Pour le modifier sans passer par le serveur, l’éditeur de fichiers de Yoast SEO (menu Outils) permet de le créer et de le changer depuis l’administration. Après toute modification, revérifiez l’adresse /robots.txt et testez une page importante avec l’Inspection d’URL. Cette vérification fait partie de tout bon audit technique, et de notre accompagnement SEO.
À lire aussi : pour comprendre ce que Google fait des pages en double, voir le contenu dupliqué : risques réels et solutions.
C’est un fichier texte placé à la racine d’un site qui indique aux robots des moteurs de recherche les pages ou dossiers qu’ils peuvent explorer ou non. Il oriente l’exploration, mais ne protège pas les contenus.
Ajoutez /robots.txt à la fin de l’adresse du site, par exemple votresite.fr/robots.txt. Le fichier est public et s’affiche directement dans le navigateur.
Googlebot est le robot d’exploration de Google. Il parcourt les pages web pour les découvrir et les analyser avant qu’elles ne soient éventuellement indexées.
WordPress génère un fichier virtuel par défaut. Pour le personnaliser, créez-le via un plugin SEO comme Yoast SEO ou déposez un fichier robots.txt à la racine du site, puis vérifiez le résultat sur /robots.txt.
Non. Sans fichier, les robots explorent tout ce qu’ils trouvent. Il devient utile dès que vous voulez écarter des zones sans intérêt pour la recherche ou signaler votre sitemap.
Promesse, rythme, format, collecte conforme et indicateurs : construire une newsletter d'entreprise que vos clients…
Lire plusLes cinq paramètres UTM, une convention de nommage simple, des cas d'usage et les erreurs…
Lire plusTrafic qualifié, demandes, coût par demande, taux de transformation et chiffre d'affaires généré : cinq…
Lire plusDemandez un audit gratuit : nous vérifions l’exploration et l’indexation de vos pages et vous indiquons les priorités.
Demander mon audit gratuit