Robots.txt
Definizione breve
Robots.txt è un semplice file di testo nella radice di un sito che dice ai motori di ricerca e ad altri crawler quali pagine possono scansionare.
Un sito può chiudere ai crawler sezioni che non hanno motivo di apparire nei risultati di ricerca, come un pannello di amministrazione o una pagina del carrello, tramite robots.txt. Il file è una direttiva, non una regola; i crawler ben educati la rispettano, ma non è una barriera imposta.
Scrivere male robots.txt può bloccare per errore l'intero sito dalla scansione, facendolo sparire del tutto dai risultati di ricerca. Più di recente, il file viene usato anche per indicare se i crawler di intelligenza artificiale possono raccogliere i contenuti come dati di addestramento.
Robots.txt viene spesso confuso con il tag noindex, anche se svolgono compiti diversi: una regola disallow impedisce la scansione di una pagina, ma se un'altra pagina vi rimanda, un motore di ricerca può comunque elencarla senza descrizione, per rimuoverla davvero dall'indice serve un tag noindex o una richiesta di rimozione. Questo si può verificare tramite lo strumento di ispezione URL di Google Search Console.
Perché conta
Un robots.txt configurato male può rendere invisibile a un motore di ricerca un intero sito, o le sue pagine più importanti. Configurarlo bene tiene nascoste le pagine che devono restarlo e garantisce la scansione di quelle che contano.
Esempio illustrativo
Durante un aggiornamento software, un'azienda ha lasciato per errore una riga di robots.txt che bloccava l'intero sito, sparendo dalle ricerche per una settimana.
