
Par Richard Cohen
Founder & SEO Strategist
Réponse courte : Le fichier robots.txt sert à gérer l'accès des robots à certaines URL ; il doit être modifié avec prudence car un blocage peut empêcher l'exploration des ressources utiles.
Un robots.txt court peut avoir des effets larges. Les erreurs viennent souvent d'une règle ajoutée pendant une recette, d'un motif trop général ou d'une confusion entre empêcher le crawl et empêcher l'indexation. Avant de changer une directive, il faut identifier la ressource réellement visée.
Séparer crawl et indexation
Bloquer une URL dans robots.txt ne remplace pas une consigne d'indexation. Une page peut être connue de Google par des liens externes ou internes même si son contenu ne peut pas être exploré. Choisissez le mécanisme adapté à l'objectif.
Éviter les motifs trop larges
Testez les règles contre les chemins réellement utilisés par le site. Une directive qui couvre un dossier commun peut affecter des pages produit, des images, du JavaScript ou des CSS nécessaires au rendu.
Contrôler après chaque déploiement
Vérifiez la version servie en production, l'URL du sitemap déclarée et les ressources critiques. Lorsqu'une règle change, consignez la raison et les URL attendues pour pouvoir revenir en arrière si elle produit un effet indésirable.
Repère documenté
La documentation Google sur robots.txt explique que ce fichier indique aux robots les zones auxquelles ils peuvent accéder. Elle recommande de tester les règles et de ne pas l'utiliser comme unique mécanisme pour retirer une page des résultats.
Contrôles à effectuer
Pour aller plus loin
Sources
Questions fréquentes
Robots.txt peut-il désindexer une page ?
Il contrôle avant tout l'accès au crawl. Pour maîtriser l'indexation, utilisez les mécanismes adaptés et vérifiez le comportement de l'URL finale.
Faut-il bloquer les paramètres d'URL ?
Pas systématiquement. Commencez par comprendre leur usage, les liens qui les génèrent et leur valeur. Un blocage trop large peut masquer des ressources utiles au rendu ou au contrôle.
