Vérification en directGratuit, sans inscription

Audit robots.txt et sitemap

Vérifiez robots.txt et sitemap sur un seul écran, sans inscription.

rabbitclip · Outil

Cet outil lit d'abord le fichier robots.txt de votre domaine : s'il existe, sa taille, le nombre de groupes de règles, un avertissement pour un Disallow: / qui bloque tout le site, les lignes Sitemap: présentes, la valeur Crawl-delay et les erreurs de syntaxe comme une directive inconnue. Il lit ensuite le sitemap indiqué dans robots.txt, ou /sitemap.xml à défaut ; s'il s'agit d'un index, il descend dans les deux premiers sous-fichiers, avec trois fichiers sitemap téléchargés au maximum au total.

Le rapport indique le type de sitemap, simple liste ou index, le nombre d'adresses, la part munie d'une date lastmod, la plus récente et la plus ancienne lastmod, les adresses pointant vers un autre domaine, un mélange de http et https, la proximité avec la limite officielle de 50 000 adresses ou 50 Mo, et la présence de balises hreflang (xhtml:link). Il envoie aussi une requête HEAD aux cinq premières adresses et affiche leurs codes de statut.

Ce contrôle envoie dix requêtes sortantes au maximum, donc pour un très grand index de sitemap il n'examine que les premières parties et non l'ensemble ; le nombre d'adresses affiché reflète ce qui a été lu, pas chaque page de votre site. Si robots.txt bloque tout le site ou qu'aucun sitemap n'est trouvé, cela apparaît comme un avertissement à part, mais seul un outil comme Google Search Console confirme la façon dont un moteur de recherche explore réellement votre site.

Questions fréquentes

Que se passe-t-il si je n'ai pas de sitemap ?

Si l'outil ne trouve aucune ligne Sitemap: dans robots.txt ni rien à /sitemap.xml, il signale cela comme manquant. Il est alors utile de créer et publier un sitemap pour que les moteurs de recherche découvrent vos adresses.

Lit-il chaque fichier d'un grand index de sitemap ?

Non, il télécharge trois fichiers sitemap au maximum et ne descend que dans les deux premiers sous-fichiers d'un index ; le rapport indique clairement cette limite plutôt que de prétendre représenter tout le site.

Le domaine que je saisis est-il conservé ?

Non, rien n'est conservé de façon permanente ; si le même domaine est vérifié à nouveau peu après, il reste en mémoire du serveur environ dix minutes, puis il est effacé.

Le réglage Crawl-delay fonctionne-t-il sur Google ?

Google ignore cette directive ; Bing et certains autres robots peuvent en tenir compte, l'outil affiche donc la valeur mais son effet dépend du robot qui la lit.

Articles liés

Autres outils

Si vous ne savez pas par où commencer, ce n’est pas un problème ; vous êtes au bon endroit.

Le projet que vous avez en tête peut être déjà clair, ou encore une simple idée. Les deux nous conviennent. En un court appel, nous parlons ensemble d’où vous en êtes et où vous pouvez aller.

Fixons un appel
Parlons du projet