Testeur robots.txt : les moteurs de recherche peuvent-ils explorer cette page ?
Saisissez l'adresse d'une page et choisissez un robot d'exploration. Le testeur lit le robots.txt du site, trouve la règle déterminante et vous indique si la page peut être explorée.
Cet outil vérifie un seul point. Le Vérificateur SEO de site web IA analyse tout votre site web : 23 contrôles, toutes les pages publiques, trois pages lues en détail et les mots-clés sur lesquels vous pouvez vous positionner.
Analysez le SEO de votre site web avec l'IA →À quoi sert le fichier robots.txt
Le fichier robots.txt est un simple fichier texte placé à la racine d'un site web (votreentreprise.fr/robots.txt). Les robots d'exploration le lisent avant toute chose pour savoir quelles parties du site ils peuvent visiter. C'est une demande, pas un verrou : les robots bien élevés comme Googlebot et Bingbot le respectent, tandis que les robots malveillants l'ignorent. Ne comptez donc jamais sur lui pour cacher des pages privées.
Comment ce testeur décide
- Il trouve le bon groupe. Le fichier robots.txt est divisé en groupes, qui commencent chacun par une ou plusieurs lignes User-agent. Un robot d'exploration suit le groupe dont le nom lui correspond le plus précisément (Googlebot-Image suit un groupe Googlebot-Image, à défaut un groupe Googlebot, et à défaut le groupe commun à tous les robots, *).
- Il trouve les règles qui correspondent à l'adresse. Une règle correspond quand l'adresse commence par son chemin. Un astérisque (*) remplace n'importe quel texte et le signe dollar ($) marque la fin de l'adresse.
- La règle la plus précise l'emporte. Parmi toutes les règles qui correspondent, c'est celle qui a le chemin le plus long qui décide. Quand un Allow et un Disallow ont la même longueur, Allow l'emporte. Si aucune règle ne correspond, la page peut être explorée.
Ce sont les règles que Google publie et applique : la réponse obtenue ici est donc celle que reçoit Googlebot.
Les erreurs courantes
- Un Disallow: / oublié depuis le site de développement, qui exclut tout le site des résultats de recherche.
- Bloquer les dossiers CSS et JavaScript, ce qui empêche Google d'afficher la page telle que les visiteurs la voient.
- Utiliser robots.txt pour retirer une page de Google. Une page bloquée peut quand même apparaître, sans description, si d'autres sites pointent vers elle. Utilisez plutôt une balise noindex, et laissez la page être explorée pour que Google la voie.
- Un robots.txt qui répond par une erreur serveur. Google suspend alors l'exploration de tout le site.
Le fichier robots.txt est aussi le meilleur endroit pour indiquer votre sitemap, avec une ligne Sitemap. Vérifiez-le avec le vérificateur de sitemap, et voyez comment Google lit l'ensemble de votre site avec le Vérificateur SEO de site web IA.
Testeur robots.txt : questions et réponses
À quoi sert robots.txt ?
Il indique aux robots d'exploration quelles parties d'un site ils peuvent visiter. Il ne retire pas de pages de Google : une page bloquée peut quand même être indexée si d'autres sites pointent vers elle. Pour tenir une page à l'écart des résultats, utilisez une balise noindex et laissez-la explorable.
Quelle règle l'emporte quand deux règles correspondent ?
Google applique la règle la plus précise, celle dont le chemin est le plus long. Quand une règle Allow et une règle Disallow sont de même longueur, Allow l'emporte. Ce testeur suit les mêmes règles.
Que se passe-t-il quand un site n'a pas de robots.txt ?
Si robots.txt renvoie « introuvable », les robots d'exploration peuvent tout explorer. Si le serveur répond par une erreur (un code 5xx), Google arrête d'explorer le site pendant un moment : un robots.txt défaillant est donc pire que pas de robots.txt du tout.
Faut-il bloquer les robots d'exploration IA comme GPTBot ?
C'est un choix d'entreprise. Les bloquer tient votre contenu à l'écart d'une partie de l'entraînement et des réponses des IA, mais peut aussi tenir votre entreprise à l'écart des réponses que les gens lisent dans les assistants IA.
AI Web Maker