Robots.txt
Definición breve
Robots.txt es un simple archivo de texto en la raíz de un sitio que indica a los buscadores y otros rastreadores qué páginas pueden explorar.
Un sitio puede cerrar a los rastreadores secciones que no tienen nada que hacer en los resultados de búsqueda, como un panel de administración o una página de carrito, mediante robots.txt. El archivo es una directriz, no una regla; los rastreadores bien educados la respetan, pero no es una barrera obligatoria.
Escriba mal robots.txt y todo un sitio puede quedar bloqueado por accidente, desapareciendo por completo de los resultados de búsqueda. Más recientemente, el archivo también se usa para indicar si los rastreadores de IA pueden recopilar contenido como datos de entrenamiento.
Robots.txt suele confundirse con la etiqueta noindex, aunque cumplen funciones distintas: una regla disallow impide que se rastree una página, pero si otra página enlaza hacia ella, un buscador puede igualmente listarla sin descripción, para retirarla realmente del índice hace falta una etiqueta noindex o una solicitud de eliminación. Esto puede comprobarse mediante la herramienta de inspección de URL de Google Search Console.
Por qué importa
Un robots.txt mal configurado puede volver invisible para un buscador a un sitio entero, o a sus páginas más importantes. Configurarlo bien mantiene ocultas las páginas que deben estarlo y garantiza que se rastreen las que importan.
Ejemplo ilustrativo
Durante una actualización de software, una empresa dejó por error una línea de robots.txt que bloqueaba todo el sitio, y desapareció por completo de las búsquedas durante una semana.
