Vérificateur de robots.txt
Téléchargez le robots.txt d'un site et vérifiez si un robot d'exploration peut accéder à un chemin — évalué selon les vraies règles de crawl, avec la ligne décisive affichée.
⚠️ Impossible de vérifier ce site
- Chemin testé
- Groupe de règles
- Règle décisive
robots.txt brut
Questions fréquentes
Que signifient vraiment les résultats ?
Le verdict vaut pour un seul couple (robot, chemin) : “Autorisé” ou “Bloqué” selon le robots.txt réel du site. La page montre de quel groupe user-agent proviennent les règles et la règle unique qui a tranché. L'évaluation suit exactement RFC 9309 : le motif correspondant le plus long gagne, un Allow bat un Disallow de même longueur, l'astérisque correspond à tout caractère y compris la barre, un $ final ancre la fin, et sans règle correspondante tout est autorisé. Un Disallow vide est sans effet, comme le traitent les grands moteurs.
Pourquoi Googlebot couvre-t-il aussi Googlebot-News et Googlebot-Image ?
RFC 9309 précise que les groupes user-agent sont comparés par PRÉFIXE insensible à la casse du jeton du robot : un groupe écrit pour “Googlebot” régit donc aussi Googlebot-News, Googlebot-Image, Googlebot-Video, etc. Les sites s'appuient là-dessus pour écrire un seul ensemble pour toute la famille. Vous pouvez saisir n'importe quel nom exact (par exemple “GPTBot” ou “Baiduspider-image”) ; si le site a un groupe pour lui, seules ses règles s'appliquent.
Cet outil charge-t-il ma page ? D'où vient le robots.txt ?
Il télécharge uniquement le /robots.txt de la cible, jamais la page elle-même, et le 'download est fait par un serveur de ce site car le navigateur ne peut pas lire le robots.txt d'un autre domaine (CORS). Le download est limité, plafonné à 512 Ko, suit au plus 3 redirections et refuse les adresses privées ou réservées. Le fichier est analysé entièrement dans votre navigateur ; aucun compte requis, votre URL n'est pas stockée.
Ce que le vérificateur contrôle
- Santé de la récupération — code de statut, chaînes de redirection et content-type vérifiés avant le parsing ; une page HTML servie à /robots.txt échoue bruyamment.
- Audit des directives — directives inconnues signalées (les crawlers les ignorent) ; crawl-delay confronté aux limites des principaux bots.
- Simulation d’URL — collez des chemins et chacun répond Allowed/Blocked avec la ligne exacte correspondante citée.
- Présence de sitemap — déclarations Sitemap extraites et vérifiées en matière d’accessibilité.
Voyez votre robots.txt comme les bots le voient
Récupération, parsing et simulation — chaque règle Disallow testée contre vos propres URL, verdict affiché chemin par chemin.
De vraies règles, un vrai verdict
Télécharge le robots.txt réel et l'évalue exactement comme les moteurs : motif le plus long RFC 9309, Allow avant Disallow, groupes par préfixe — jamais d'estimation.
La ligne décisive est affichée
Au-delà du simple Autorisé / Bloqué, vous voyez la règle exacte qui a tranché et le groupe user-agent d'origine : vous comprenez pourquoi.
Pas de chargement de page, gratuit
Seul le robots.txt public est récupéré (jamais votre page), via un lecteur limité, plafonné à 512 Ko, qui refuse les adresses privées. Sans compte ni crédits.
Outils associés
Qu'est-ce qu'un vérificateur de robots.txt ?
Un vérificateur de robots.txt télécharge le robots.txt d'un site et vous indique exactement ce qu'un agent d'exploration peut récupérer — évalué comme le font les grands moteurs de recherche. robots.txt est un petit fichier texte public que chaque site peut publier pour dire quels chemins les robots peuvent ou ne peuvent pas explorer (“Disallow: /admin/”, “Allow: /public/”, groupés par robot sous des lignes User-agent). Ce n'est pas une frontière de sécurité, mais c'est ainsi que vos préférences d'exploration sont communiquées — et une règle mal écrite est une cause fréquente de page cachée à Google par accident. Cet outil lit ce fichier et applique les règles de RFC 9309 : le motif le plus long gagne, un Allow bat un Disallow de même longueur, l'astérisque correspond à tout caractère, un $ final ancre la fin, et un groupe s'applique à un robot quand son jeton est un préfixe insensible à la casse du nom du bot.
Ce que montre cet outil
- Un verdict instantané Autorisé / Bloqué pour un couple exact (chemin, robot)
- La règle qui a tranché et son groupe user-agent
- Le statut HTTP de la réponse robots.txt (404 = tout est autorisé)
- Des compteurs de groupes, de règles correspondantes et de sitemaps
- Le robots.txt brut pour vérification
Quand l'utiliser
- Avant de lancer une section, confirmer qu'elle est explorable par Googlebot
- Déboguer une page absente de Google — vérifier si une règle la bloque
- Vérifier qu'un Allow l'emporte vraiment sur un Disallow antérieur (erreur fréquente)
- En ajoutant de nouveaux robots (IA, robots d'images), confirmer les chemins utilisables
Note de confidentialité : cet outil envoie l'URL saisie à un serveur de ce site, qui télécharge uniquement le robots.txt public de la cible — votre page n'est jamais chargée. L'analyse se fait dans votre navigateur, les résultats sont mis en cache brièvement, aucun compte et rien n'est stocké sur vous.
Outils associés
Générateur de balises meta
Balises title, description, keywords, canonical et robots avec aperçu Google en direct
Aperçu SERP
Voyez précisément comment votre titre et votre description s'affichent dans les résultats Google — avec des alertes de troncature au pixel près.
Générateur de liens UTM
Créez en quelques secondes des liens de campagne propres et correctement encodés, avec des modèles en un clic pour Facebook Ads, Google Ads et plus.