Controllo robots.txt e sitemap
Verifichi robots.txt e sitemap in un'unica schermata, senza registrazione.
Questo strumento legge prima il file robots.txt del suo dominio: se esiste, la sua dimensione, il numero di gruppi di regole, un avviso per un Disallow: / che blocca l'intero sito, le righe Sitemap: presenti, il valore di Crawl-delay ed errori di sintassi come una direttiva sconosciuta. Legge poi il sitemap indicato in robots.txt, oppure /sitemap.xml se non ce n'è uno; se è un indice, entra nei primi due sottofile, scaricando al massimo tre file sitemap in totale.
Il rapporto mostra il tipo di sitemap, elenco semplice o indice, il numero di indirizzi, la quota con data lastmod, la lastmod più recente e quella più vecchia, indirizzi che puntano a un altro dominio, una mescolanza di http e https, la vicinanza al limite ufficiale di 50.000 indirizzi o 50 MB, e la presenza di tag hreflang (xhtml:link). Invia inoltre una richiesta HEAD ai primi cinque indirizzi e mostra i relativi codici di stato.
Questo controllo effettua al massimo dieci richieste in uscita, quindi su un indice di sitemap molto grande esamina solo le prime parti e non l'intero albero; il numero di indirizzi mostrato riflette quanto letto, non ogni pagina del suo sito. Se robots.txt blocca l'intero sito o non si trova alcun sitemap, lo vedrà segnalato a parte, ma solo uno strumento come Google Search Console conferma come un motore di ricerca esplora davvero il suo sito.
Domande frequenti
Cosa succede se non ho un sitemap?
Se lo strumento non trova alcuna riga Sitemap: in robots.txt né nulla su /sitemap.xml, lo segnala come mancante. In tal caso conviene creare e pubblicare un sitemap perché i motori di ricerca trovino i suoi indirizzi.
Legge ogni file di un grande indice di sitemap?
No, scarica al massimo tre file sitemap ed entra solo nei primi due sottofile di un indice; il rapporto indica chiaramente questo limite invece di rappresentare l'intero sito.
Il dominio che inserisco viene conservato?
No, non viene conservato in modo permanente; se lo stesso dominio viene controllato di nuovo poco dopo, resta nella memoria del server per circa dieci minuti e poi viene eliminato.
L'impostazione Crawl-delay funziona su Google?
Google ignora questa direttiva; Bing e alcuni altri crawler potrebbero considerarla, quindi lo strumento mostra il valore ma il suo effetto dipende dal crawler che lo legge.
