Crawler IA e robots.txt: consentire o bloccare
GPTBot, ClaudeBot e PerplexityBot scansionano un sito ciascuno per un motivo diverso. Spieghiamo come decidere cosa consentire e cosa bloccare.
Team rabbitclipPubblicato: 4 min di lettura
In breve
GPTBot, ClaudeBot e PerplexityBot svolgono ciascuno un compito diverso sullo stesso sito: uno raccoglie contenuti per addestrare un modello, un altro visita un sito rispondendo alla domanda dal vivo di una persona specifica, un altro ancora indicizza una pagina per costruire una risposta in stile ricerca. Bloccare un crawler in robots.txt ferma solo quel compito; un altro bot della stessa azienda può continuare a visitare il sito per uno scopo diverso.
La pagina di supporto di Anthropic descrive tre bot distinti: ClaudeBot raccoglie dati di addestramento, Claude-User visita una pagina per conto di una persona che pone una domanda a Claude, e Claude-SearchBot valuta i contenuti per risposte in stile ricerca. Tutti e tre rispettano robots.txt, ma ciascuno viene gestito separatamente.
Cosa fanno davvero questi crawler?
Il nome di un crawler di solito suggerisce il suo compito, ma ogni azienda chiama i propri bot in modo diverso. In Anthropic, ClaudeBot raccoglie dati di addestramento, Claude-User visita una pagina dal vivo per conto di un utente, Claude-SearchBot valuta i contenuti per risposte di qualità da motore di ricerca.
Sul versante OpenAI, GPTBot scansiona per addestrare il modello mentre OAI-SearchBot alimenta la funzione di ricerca di ChatGPT; un sito può bloccare GPTBot pur continuando a consentire OAI-SearchBot. Quali sotto-compiti esatti PerplexityBot suddivida tra agenti separati può variare in base alla situazione; l'elenco aggiornato si trova sempre nella documentazione crawler di quella stessa azienda.
Cosa costa bloccare, cosa fa guadagnare consentire?
Bloccare un bot di addestramento (GPTBot, ClaudeBot) impedisce a quell'azienda di usare i contenuti di un sito nei futuri addestramenti del modello. In cambio, può aumentare anche il rischio di non comparire mai come fonte nelle risposte di quel modello, poiché spesso lo stesso contenuto alimenta sia l'addestramento sia la generazione delle risposte.
Bloccare un bot di ricerca o rivolto all'utente (Claude-User, OAI-SearchBot) produce un risultato diverso: il sito smette semplicemente di comparire nelle risposte dal vivo di quell'assistente. Per un sito e-commerce questa è di solito una perdita indesiderata; per un sito di contenuti in abbonamento può essere una scelta deliberata.
Come scrivere la regola in robots.txt: una guida pratica
Bloccare o consentire un crawler è questione di poche righe di regola in un file robots.txt.
- Aprite il file robots.txt nella radice del sito (per esempio nomesito.com/robots.txt).
- Per un bot da bloccare, scrivete «Disallow: /» sotto una riga «User-agent: GPTBot».
- Per un bot da consentire, aprite un blocco User-agent separato e lasciate vuota la riga «Disallow:».
- Definite ogni bot nel proprio blocco; elencare più nomi di bot in un unico blocco potrebbe non funzionare come previsto.
- Dopo la modifica, verificate direttamente nel browser che il file live sia visualizzato correttamente.
Bloccare un bot blocca anche gli altri?
No. La documentazione di Anthropic chiarisce che bloccare ClaudeBot ferma solo la raccolta di dati di addestramento e non riguarda Claude-SearchBot né Claude-User; i tre vengono gestiti separatamente in robots.txt.
Questo significa che un sito può prendere decisioni distinte in base alle proprie priorità: disattivare la raccolta di dati di addestramento continuando comunque a comparire nelle risposte dal vivo dell'assistente è tecnicamente possibile.
Errori frequenti
Un errore frequente visto presso un produttore di pavimenti è bloccare tutti i bot IA con un'unica regola generale, «Disallow: /» sotto «User-agent: *», il che ferma i bot di addestramento indesiderati insieme ai bot di ricerca e assistente che l'azienda voleva davvero.
Un altro errore è aggiornare robots.txt senza verificarlo live; una cache del server o un percorso file sbagliato possono far sì che la modifica non entri mai realmente in vigore.
Non esiste un'unica risposta corretta tra consentire e bloccare, un sito e-commerce e un sito di contenuti in abbonamento possono ragionevolmente arrivare a decisioni diverse qui. Ciò che conta è decidere con un quadro chiaro di cosa fa ciascun bot, invece di trattarli tutti come un'unica categoria. Una breve chiamata con rabbitclip basta per rivedere le regole robots.txt attuali di un sito.
Domande frequenti
Se blocco GPTBot, sparisco del tutto da ChatGPT?
GPTBot raccoglie dati di addestramento; OAI-SearchBot, che alimenta la funzione di ricerca di ChatGPT, viene gestito separatamente, quindi potete continuare a comparire sul lato ricerca finché non bloccate anche quello.
Ha senso bloccare tutti i bot IA con un'unica regola?
Di solito no; questo ferma i bot di addestramento indesiderati insieme ai bot di ricerca e assistente che potreste effettivamente volere.
Una modifica a robots.txt ha effetto immediato?
I bot rileggono il file secondo la propria frequenza di scansione; questo tempo non è fisso, quindi la modifica si riflette gradualmente, non subito.
Come si decide quali bot bloccare?
Si tratta di bilanciare il non voler condividere dati di addestramento con il non voler perdere visibilità in ricerca e assistenti; la risposta giusta cambia da sito a sito.
