Rastreadores de IA y robots.txt: permitir o bloquear
GPTBot, ClaudeBot y PerplexityBot rastrean un sitio cada uno por un motivo distinto. Explicamos cómo decidir qué permitir y qué bloquear.
Equipo de rabbitclipPublicación: 4 min. de lectura
En breve
GPTBot, ClaudeBot y PerplexityBot cumplen cada uno una función distinta en el mismo sitio: uno recopila contenido para entrenar un modelo, otro visita un sitio mientras responde a la pregunta en directo de una persona concreta, otro indexa una página para construir una respuesta de tipo buscador. Bloquear un rastreador en robots.txt detiene solo esa función; otro bot de la misma empresa puede seguir visitando el sitio con otro fin.
La propia página de ayuda de Anthropic describe tres bots independientes: ClaudeBot recopila datos de entrenamiento, Claude-User visita un sitio en nombre de una persona que le pregunta algo a Claude, y Claude-SearchBot evalúa el contenido para respuestas de tipo búsqueda. Los tres respetan robots.txt, pero cada uno se gestiona por separado.
¿Qué hacen realmente estos rastreadores?
El nombre de un rastreador suele insinuar su función, pero cada empresa nombra sus bots de forma distinta. En Anthropic, ClaudeBot recopila datos de entrenamiento, Claude-User visita una página en vivo en nombre de un usuario, Claude-SearchBot evalúa el contenido para respuestas de calidad de búsqueda.
En el lado de OpenAI, GPTBot rastrea para entrenar el modelo mientras que OAI-SearchBot alimenta la función de búsqueda de ChatGPT; un sitio puede bloquear GPTBot y seguir permitiendo OAI-SearchBot. Qué subtareas exactas reparte PerplexityBot entre agentes distintos puede variar según la situación; la lista actual siempre está en la documentación propia de rastreadores de esa empresa.
¿Qué cuesta bloquear, qué se gana al permitir?
Bloquear un bot de entrenamiento (GPTBot, ClaudeBot) impide que esa empresa use el contenido de un sitio en futuros entrenamientos de modelos. A cambio, el riesgo de no aparecer nunca como fuente en las respuestas de ese modelo también puede aumentar, ya que el mismo contenido suele alimentar tanto el entrenamiento como la generación de respuestas.
Bloquear un bot de búsqueda o de cara al usuario (Claude-User, OAI-SearchBot) produce un resultado distinto: el sitio simplemente deja de aparecer en las respuestas en directo de ese asistente. Para un sitio de comercio electrónico eso suele ser una pérdida no deseada; para un sitio de contenido por suscripción puede ser una decisión deliberada.
Cómo escribir la regla en robots.txt: una guía práctica
Bloquear o permitir un rastreador es cuestión de unas pocas líneas de regla dentro de un archivo robots.txt.
- Abra el archivo robots.txt en la raíz del sitio (por ejemplo, nombredelsitio.com/robots.txt).
- Para un bot que quiera bloquear, escriba «Disallow: /» bajo una línea «User-agent: GPTBot».
- Para un bot que quiera permitir, abra un bloque User-agent aparte y deje la línea «Disallow:» vacía.
- Defina cada bot en su propio bloque; poner varios nombres de bot bajo un mismo bloque puede no funcionar como se espera.
- Tras el cambio, compruebe directamente en el navegador que el archivo en producción se muestra correctamente.
¿Bloquear un bot bloquea también a los demás?
No. La propia documentación de Anthropic indica que bloquear ClaudeBot detiene solo la recopilación de datos de entrenamiento y no afecta a Claude-SearchBot ni a Claude-User; los tres se gestionan por separado en robots.txt.
Eso significa que un sitio puede tomar decisiones distintas según sus propias prioridades: desactivar la recopilación de datos de entrenamiento mientras se sigue apareciendo en las respuestas en directo del asistente es técnicamente posible.
Errores frecuentes
Un error frecuente visto en un fabricante de suelos es bloquear todos los bots de IA con una sola regla general, «Disallow: /» bajo «User-agent: *», lo que detiene los bots de entrenamiento no deseados junto con los bots de búsqueda y asistente que el negocio sí quería.
Otro error es actualizar robots.txt sin comprobarlo en producción; una caché del servidor o una ruta de archivo incorrecta pueden hacer que el cambio nunca llegue realmente a aplicarse.
No hay una única respuesta correcta a permitir o bloquear, un sitio de comercio electrónico y un sitio de contenido por suscripción pueden llegar razonablemente a decisiones distintas aquí. Lo importante es decidir con una idea clara de lo que hace cada bot, en lugar de tratarlos todos como una sola categoría. Una llamada breve con rabbitclip basta para revisar las reglas actuales de robots.txt de un sitio.
Preguntas frecuentes
Si bloqueo GPTBot, ¿desaparezco por completo de ChatGPT?
GPTBot recopila datos de entrenamiento; OAI-SearchBot, que alimenta la función de búsqueda de ChatGPT, se gestiona por separado, así que puede seguir apareciendo en el lado de búsqueda mientras no bloquee también ese.
¿Tiene sentido bloquear todos los bots de IA con una sola regla?
Normalmente no; eso detiene los bots de entrenamiento no deseados junto con los bots de búsqueda y asistente que quizá sí quiera conservar.
¿Un cambio en robots.txt se aplica de inmediato?
Los bots vuelven a leer el archivo según su propia frecuencia de rastreo; ese tiempo no es fijo, así que el cambio se refleja de forma gradual, no instantánea.
¿Cómo decido qué bots bloquear?
Se trata de equilibrar el no querer compartir datos de entrenamiento con el no querer perder visibilidad en búsqueda y en asistentes; la respuesta correcta varía según el sitio.
