Auditoría de robots.txt y sitemap
Verifique robots.txt y sitemap en una sola pantalla, sin registro.
Esta herramienta lee primero el archivo robots.txt de su dominio: si existe, su tamaño, el número de grupos de reglas, un aviso si un Disallow: / bloquea todo el sitio, las líneas Sitemap: presentes, el valor de Crawl-delay y errores de sintaxis como una directiva desconocida. A continuación lee el sitemap indicado en robots.txt, o /sitemap.xml si no hay ninguno; si es un índice, entra en los dos primeros subarchivos, descargando como máximo tres archivos sitemap en total.
El informe muestra el tipo de sitemap, lista simple o índice, el número de direcciones, la proporción con fecha lastmod, la lastmod más reciente y la más antigua, direcciones que apuntan a otro dominio, una mezcla de http y https, la cercanía al límite oficial de 50.000 direcciones o 50 MB, y si hay etiquetas hreflang (xhtml:link). También envía una solicitud HEAD a las cinco primeras direcciones y muestra sus códigos de estado.
Esta comprobación hace como máximo diez solicitudes salientes, por lo que en un índice de sitemap muy grande solo examina las primeras partes y no todo el árbol; el número de direcciones mostrado refleja lo leído, no cada página de su sitio. Si robots.txt bloquea todo el sitio o no se encuentra ningún sitemap, lo verá marcado por separado, pero solo una herramienta como Google Search Console confirma cómo rastrea realmente su sitio un buscador.
Preguntas frecuentes
¿Qué pasa si no tengo sitemap?
Si la herramienta no encuentra ninguna línea Sitemap: en robots.txt ni nada en /sitemap.xml, lo marca como ausente. En ese caso conviene crear y publicar un sitemap para que los buscadores encuentren sus direcciones.
¿Lee todos los archivos de un índice de sitemap grande?
No, descarga como máximo tres archivos sitemap y solo entra en los dos primeros subarchivos de un índice; el informe indica claramente este límite en lugar de representar todo el sitio.
¿Se guarda el dominio que introduzco?
No, no se guarda de forma permanente; si el mismo dominio se comprueba de nuevo poco después, permanece en la memoria del servidor unos diez minutos y luego se elimina.
¿El ajuste Crawl-delay funciona en Google?
Google ignora esta directiva; Bing y algunos otros rastreadores pueden tenerla en cuenta, por eso la herramienta muestra el valor, pero su efecto depende de qué rastreador la lea.
