Vérificateur de robots.txt
Collez votre fichier ou saisissez un domaine. L'outil applique les règles de la RFC 9309, signale les erreurs et vous dit si un robot donné peut explorer une URL.
Confidentialité et coût
Cet outil demande depuis nos serveurs l'URL publique que vous saisissez. Il est gratuit, limité en fréquence contre les abus, et nous ne conservons ni l'URL ni le contenu de la page.
Comment ça marche
- Saisissez un domaine pour récupérer son robots.txt, ou collez le contenu du fichier.
- Lisez les erreurs et avertissements de syntaxe, avec le numéro de ligne, ainsi que les groupes analysés.
- Testez des URL pour un robot (Googlebot, Bingbot, GPTBot…) : l'outil indique la règle décisive, la plus longue correspondance l'emportant.
Exemple
Sur un fichier d'exemple de deux groupes, l'outil signale « Noindex » (ligne 6, non pris en charge par Google) et un Crawl-delay (ligne 5, ignoré par Google). Pour Googlebot, /private/report.html est bloqué par « Disallow: /private/ » (ligne 2), /private/press-kit.pdf est autorisé par « Allow: /private/press-kit.pdf » (ligne 3) et /shoes?sort=price est bloqué par « Disallow: /*?sort= » (ligne 4).
Ce que signifie le résultat
Une URL est autorisée sauf si une règle Disallow la vise : quand plusieurs règles correspondent, la plus spécifique (la plus longue) l'emporte et Allow gagne à égalité. Les robots utilisent le groupe du user-agent le plus précis, sinon celui de « * ». Un fichier de plus de 500 Kio est tronqué par les robots.
Problèmes courants que cet outil aide à résoudre
- Une règle Disallow trop large qui bloque des pages importantes sans que personne ne s'en aperçoive.
- Des directives ignorées (Noindex, fautes de frappe, Crawl-delay pour Google) que l'on croit actives.
- Un groupe pour Googlebot qui ne reprend pas les règles du groupe « * » : les robots n'appliquent qu'un seul groupe.
- Un robots.txt inaccessible (erreur 5xx) ou trop lourd, dont le comportement est mal compris.
Questions fréquentes
Pourquoi une URL bloquée apparaît-elle quand même dans Google ?
Robots.txt bloque l'exploration, pas l'indexation. Google peut indexer l'URL sans son contenu si d'autres pages y renvoient. Pour l'exclure, laissez-la explorable et utilisez noindex.
L'outil récupère-t-il mon fichier depuis mon navigateur ?
Non : la récupération passe par notre serveur, qui contacte le site avec une requête protégée, car un navigateur ne peut pas lire le robots.txt d'un autre domaine. L'analyse du contenu se fait ensuite dans votre navigateur.
Quelle est la taille maximale d'un robots.txt ?
Google lit les 500 premiers Kio (limite de la RFC 9309). Au-delà, les règles sont ignorées ; l'outil vous prévient.
Outils associés
- Générateur de robots.txtChoisissez un modèle, ajoutez votre sitemap et des règles pour un robot précis : le fichier robots.txt est généré et relu par un parseur RFC 9309 avant le téléchargement.Gratuit · dans votre navigateur
- Vérificateur de meta robots et X-Robots-TagSaisissez une URL, ou collez le HTML et les en-têtes : l'outil lit toutes les directives robots, repère les contradictions et explique l'effet de chacune.Gratuit · sans compte
- Validateur de sitemap XMLSaisissez l'adresse du sitemap ou collez son XML : l'outil vérifie la structure, les limites, chaque valeur et calcule le découpage nécessaire.Gratuit · sans compte
- Générateur de sitemap XMLCollez vos URL, une par ligne : l'outil produit un sitemap.xml valide, l'échappe correctement et le découpe avec un index si vous dépassez les limites.Gratuit · dans votre navigateur
- Audit de blocage robotsEntrez une URL : l'outil lit le robots.txt du site, applique la norme RFC 9309 pour chaque robot et vérifie aussi les directives noindex de la page.Compte gratuit · 3 analyses en direct/jour
- Vérificateur d'accès des robots IAEntrez un site : l'outil lit son robots.txt et indique, pour chaque robot d'IA connu, s'il peut explorer, quelle ligne décide, et à quoi sert ce robot : entraînement, recherche ou action d'un utilisateur.Compte gratuit · 3 analyses en direct/jour