Краткое определение

Robots.txt это простой текстовый файл в корне сайта, который сообщает поисковикам и другим краулерам, какие страницы можно сканировать.

Сайт может закрыть от краулеров разделы, которым нечего делать в результатах поиска, например админ-панель или страницу корзины, через robots.txt. Файл это скорее указание, чем правило, воспитанные краулеры его соблюдают, но это не принудительный барьер.

Если robots.txt написан неверно, весь сайт может случайно оказаться закрытым для сканирования и полностью исчезнуть из результатов поиска. В последнее время файл также используют, чтобы указать, могут ли краулеры искусственного интеллекта собирать контент как обучающие данные.

Robots.txt часто путают с тегом noindex, хотя они решают разные задачи: правило disallow запрещает сканирование страницы, но если на нее ссылается другая страница, поисковик все равно может показать этот адрес без описания, чтобы действительно убрать страницу из индекса, нужен тег noindex или запрос на удаление. Как файл реально считывается, можно проверить через инструмент проверки URL в Google Search Console.

Почему это важно

Неверно настроенный robots.txt может сделать невидимым для поисковика весь сайт или его важнейшие страницы. Правильная настройка держит скрытыми те страницы, что должны оставаться скрытыми, и гарантирует сканирование важных.

Условный пример

Во время обновления программного обеспечения компания случайно оставила строку robots.txt, блокирующую весь сайт, и на неделю полностью пропала из поиска.

Связанные термины

Статья по теме

Если не знаете, с чего начать, — вы там, где нужно.

Проект в вашей голове может быть уже чётким или пока в виде идеи. Подходит и то, и другое. Коротким разговором обсудим вместе, где вы сейчас и куда можете прийти.

Запланируем встречу
Обсудить проект