Parcours Expertise Enjeux Références Blog Ressources Me contacter →
Thème
Langue
Outil SEO gratuit

robots.txt Validator & testeur d'URL

Analysez n'importe quel robots.txt, testez si une URL est bloquée ou autorisée pour un robot donné, et repérez les erreurs de syntaxe. Moteur de correspondance conforme à la spécification Google : règle la plus spécifique, jokers * et $, priorité à l'autorisation.

Analyse côté navigateur. La récupération par URL passe par un proxy que vous contrôlez ; sinon, collez votre fichier.

1Votre robots.txt

Saisissez le domaine : le fichier /robots.txt est déduit automatiquement.

2Tester une URL

Chemin (commençant par /) ou URL complète du même domaine.

Chargez un robots.txt puis saisissez une URL pour voir si elle est explorable.

Diagnostic du fichier

Syntaxe, groupes de règles et sitemaps déclarés, tels qu'ils sont réellement interprétés.

Validation de la syntaxe
En attente d'un fichier à analyser.
Groupes de règles
Aucun groupe pour l'instant.
Sitemaps déclarés
Aucun sitemap déclaré.

Comment ça marche

Trois étapes pour vérifier ce que les robots voient réellement.

1

Chargez le fichier

Saisissez un domaine pour récupérer son robots.txt, ou collez directement votre brouillon avant mise en ligne.

2

Testez vos URL clés

Vérifiez pour chaque robot si une URL est autorisée ou bloquée, et surtout quelle règle précise s'applique.

3

Corrigez les alertes

Directives mal placées, groupes sans user-agent, chemins sans slash : chaque anomalie est signalée avec sa ligne.

Bien penser son robots.txt

Les erreurs qui coûtent le plus cher en visibilité.

Disallow n'est pas noindex. Bloquer l'exploration n'empêche pas l'indexation d'une URL liée ailleurs. Pour retirer une page de l'index, laissez-la explorable avec une balise meta robots noindex.

Ne bloquez jamais le CSS et le JS. Google a besoin de charger ces ressources pour rendre vos pages. Un Disallow: /assets/ trop large peut casser l'évaluation du contenu et du mobile.

La règle la plus spécifique gagne. Ce n'est pas l'ordre des lignes qui compte, mais la longueur du chemin correspondant. À égalité, l'autorisation l'emporte : un Allow ciblé peut rouvrir un sous-dossier bloqué.

Un fichier par hôte et par protocole. http, https, www et sous-domaines ont chacun leur propre robots.txt. Vérifiez la bonne version, à la racine exacte du domaine.

Déclarez vos sitemaps ici aussi. La directive Sitemap: est indépendante des groupes user-agent et accélère la découverte de vos URL par tous les moteurs.

Questions fréquentes

Sur l'outil et sur le protocole d'exclusion des robots.

Comment Google choisit-il la règle qui s'applique à une URL ?
Google retient la règle dont le chemin correspondant est le plus long après expansion des jokers, indépendamment de l'ordre des lignes. Si un Allow et un Disallow correspondent avec la même longueur, l'autorisation l'emporte. C'est exactement la logique que reproduit le testeur d'URL de cet outil.
Un robots.txt peut-il désindexer une page ?
Non. Disallow empêche l'exploration, pas l'indexation. Une URL bloquée mais pointée par des liens peut apparaître dans les résultats, sans description. Pour la retirer de l'index, laissez-la explorable et ajoutez une balise noindex, ou protégez-la par mot de passe.
Les jokers * et $ sont-ils standards ?
Ils font partie de la spécification robots.txt suivie par Google, Bing et la majorité des grands moteurs. Le * remplace une suite quelconque de caractères, le $ ancre la fin de l'URL. Certains robots anciens ou secondaires ne les interprètent pas : restez explicite quand c'est possible.
Pourquoi la récupération par URL me demande-t-elle un proxy ?
Un navigateur ne peut pas lire le robots.txt d'un autre domaine directement, pour des raisons de sécurité (CORS). Le petit proxy Cloudflare fourni fait cette lecture à votre place. Tant qu'il n'est pas configuré, l'outil reste pleinement utilisable en collant le contenu du fichier.
L'outil envoie-t-il mes données quelque part ?
L'analyse, le parsing et le test d'URL s'exécutent entièrement dans votre navigateur. Seule la récupération par URL sollicite le proxy que vous hébergez vous-même. Rien n'est stocké côté serveur.

Un problème d'exploration plus large ?

Budget de crawl gaspillé, pages orphelines, indexation erratique : l'audit technique va bien au-delà du robots.txt. Voyons ce qui freine réellement votre visibilité.

Discutons de votre projet