Analysez n'importe quel robots.txt, testez si une URL est bloquée ou autorisée pour un robot donné, et repérez les erreurs de syntaxe. Moteur de correspondance conforme à la spécification Google : règle la plus spécifique, jokers * et $, priorité à l'autorisation.
Analyse côté navigateur. La récupération par URL passe par un proxy que vous contrôlez ; sinon, collez votre fichier.
Saisissez le domaine : le fichier /robots.txt est déduit automatiquement.
Chemin (commençant par /) ou URL complète du même domaine.
Syntaxe, groupes de règles et sitemaps déclarés, tels qu'ils sont réellement interprétés.
Trois étapes pour vérifier ce que les robots voient réellement.
Saisissez un domaine pour récupérer son robots.txt, ou collez directement votre brouillon avant mise en ligne.
Vérifiez pour chaque robot si une URL est autorisée ou bloquée, et surtout quelle règle précise s'applique.
Directives mal placées, groupes sans user-agent, chemins sans slash : chaque anomalie est signalée avec sa ligne.
Les erreurs qui coûtent le plus cher en visibilité.
Disallow n'est pas noindex. Bloquer l'exploration n'empêche pas l'indexation d'une URL liée ailleurs. Pour retirer une page de l'index, laissez-la explorable avec une balise meta robots noindex.
Ne bloquez jamais le CSS et le JS. Google a besoin de charger ces ressources pour rendre vos pages. Un Disallow: /assets/ trop large peut casser l'évaluation du contenu et du mobile.
La règle la plus spécifique gagne. Ce n'est pas l'ordre des lignes qui compte, mais la longueur du chemin correspondant. À égalité, l'autorisation l'emporte : un Allow ciblé peut rouvrir un sous-dossier bloqué.
Un fichier par hôte et par protocole. http, https, www et sous-domaines ont chacun leur propre robots.txt. Vérifiez la bonne version, à la racine exacte du domaine.
Déclarez vos sitemaps ici aussi. La directive Sitemap: est indépendante des groupes user-agent et accélère la découverte de vos URL par tous les moteurs.
Sur l'outil et sur le protocole d'exclusion des robots.
Allow et un Disallow correspondent avec la même longueur, l'autorisation l'emporte. C'est exactement la logique que reproduit le testeur d'URL de cet outil.Disallow empêche l'exploration, pas l'indexation. Une URL bloquée mais pointée par des liens peut apparaître dans les résultats, sans description. Pour la retirer de l'index, laissez-la explorable et ajoutez une balise noindex, ou protégez-la par mot de passe.* et $ sont-ils standards ?* remplace une suite quelconque de caractères, le $ ancre la fin de l'URL. Certains robots anciens ou secondaires ne les interprètent pas : restez explicite quand c'est possible.Budget de crawl gaspillé, pages orphelines, indexation erratique : l'audit technique va bien au-delà du robots.txt. Voyons ce qui freine réellement votre visibilité.
Discutons de votre projet