SEO

Robots.txt

Definizione breve

Robots.txt è un semplice file di testo nella radice di un sito che dice ai motori di ricerca e ad altri crawler quali pagine possono scansionare.

Un sito può chiudere ai crawler sezioni che non hanno motivo di apparire nei risultati di ricerca, come un pannello di amministrazione o una pagina del carrello, tramite robots.txt. Il file è una direttiva, non una regola; i crawler ben educati la rispettano, ma non è una barriera imposta.

Scrivere male robots.txt può bloccare per errore l'intero sito dalla scansione, facendolo sparire del tutto dai risultati di ricerca. Più di recente, il file viene usato anche per indicare se i crawler di intelligenza artificiale possono raccogliere i contenuti come dati di addestramento.

Robots.txt viene spesso confuso con il tag noindex, anche se svolgono compiti diversi: una regola disallow impedisce la scansione di una pagina, ma se un'altra pagina vi rimanda, un motore di ricerca può comunque elencarla senza descrizione, per rimuoverla davvero dall'indice serve un tag noindex o una richiesta di rimozione. Questo si può verificare tramite lo strumento di ispezione URL di Google Search Console.

Perché conta

Un robots.txt configurato male può rendere invisibile a un motore di ricerca un intero sito, o le sue pagine più importanti. Configurarlo bene tiene nascoste le pagine che devono restarlo e garantisce la scansione di quelle che contano.

Esempio illustrativo

Durante un aggiornamento software, un'azienda ha lasciato per errore una riga di robots.txt che bloccava l'intero sito, sparendo dalle ricerche per una settimana.

Termini correlati

Articolo correlato

Se non sa da dove iniziare, non è un problema: è nel posto giusto.

Il progetto che ha in mente può essere già definito, oppure ancora solo un'idea. Vanno bene entrambi. Con una breve conversazione parliamo insieme di dove si trova e dove può arrivare.

Organizziamo un incontro
Parliamo del progetto