ИИ-краулеры и robots.txt: разрешить или заблокировать
GPTBot, ClaudeBot и PerplexityBot сканируют сайт каждый по своей причине. Рассказываем, как решить, что разрешить, а что заблокировать.
Команда rabbitclipПубликация: 4 мин чтения
Коротко
GPTBot, ClaudeBot и PerplexityBot выполняют на одном и том же сайте разные задачи: один собирает контент для обучения модели, другой посещает сайт, отвечая на живой вопрос конкретного человека, третий индексирует страницу для построения ответа в стиле поиска. Блокировка одного краулера в robots.txt останавливает только эту задачу; другой бот той же компании может продолжать посещать сайт с другой целью. Из-за этого решение по одному боту не стоит автоматически распространять на остальных, требующих отдельного разбора.
Собственная справочная страница Anthropic описывает три отдельных бота: ClaudeBot собирает обучающие данные, Claude-User посещает сайт от имени человека, задающего вопрос Claude, а Claude-SearchBot оценивает контент для ответов в стиле поиска. Все три соблюдают robots.txt, но управляются по отдельности.
Что на самом деле делают эти краулеры?
Название краулера обычно намекает на его задачу, но у каждой компании свои названия ботов. В Anthropic ClaudeBot собирает обучающие данные, Claude-User посещает живую страницу от имени пользователя, Claude-SearchBot оценивает контент для ответов поискового качества.
Со стороны OpenAI GPTBot сканирует для обучения модели, а OAI-SearchBot питает функцию поиска ChatGPT; сайт может заблокировать GPTBot, продолжая при этом разрешать OAI-SearchBot. То, какие именно подзадачи PerplexityBot распределяет между отдельными агентами, может меняться в зависимости от ситуации; актуальный список всегда находится в собственной документации по краулерам этой компании. Эта разница особенно важна для сайтов, зависящих от органического трафика, а не только от разовых упоминаний.
Что теряют при блокировке и что дают при разрешении?
Блокировка обучающего бота (GPTBot, ClaudeBot) означает, что эта компания не сможет использовать контент сайта в будущем обучении модели. Взамен может вырасти и риск вообще никогда не появиться в качестве источника в ответах этой модели, поскольку один и тот же контент часто питает и обучение, и генерацию ответов.
Блокировка поискового или пользовательского бота (Claude-User, OAI-SearchBot) даёт другой результат: сайт просто перестаёт появляться в живых ответах этого ассистента. Для сайта электронной коммерции это обычно нежелательная потеря; для сайта с контентом по подписке это может быть осознанным выбором.
Как написать правило в robots.txt: практическое руководство
Блокировка или разрешение краулера сводится к нескольким строкам правила в файле robots.txt.
- Откройте файл robots.txt в корне сайта (например, sitename.com/robots.txt).
- Для бота, которого нужно заблокировать, напишите «Disallow: /» под строкой «User-agent: GPTBot».
- Для бота, которого нужно разрешить, откройте отдельный блок User-agent и оставьте строку «Disallow:» пустой.
- Определяйте каждого бота в собственном блоке; перечисление нескольких имён ботов в одном блоке может работать не так, как ожидается.
- После изменения проверьте прямо в браузере, что живой файл отображается корректно.
Блокирует ли блокировка одного бота остальных?
Нет. Собственная документация Anthropic указывает, что блокировка ClaudeBot останавливает только сбор обучающих данных и не затрагивает ни Claude-SearchBot, ни Claude-User; все три управляются в robots.txt по отдельности.
Это значит, что сайт может принимать отдельные решения в зависимости от собственных приоритетов: отключить сбор обучающих данных, но при этом продолжать появляться в живых ответах ассистента, технически возможно.
Частые ошибки
Частая ошибка, замеченная у производителя напольных покрытий, заключается в том, чтобы блокировать всех ИИ-ботов одним общим правилом, «Disallow: /» под «User-agent: *», что останавливает нежелательных обучающих ботов вместе с поисковыми и ассистентскими ботами, которые бизнес на самом деле хотел оставить.
Другая ошибка заключается в том, чтобы обновить robots.txt и не проверить это в живом виде; кеш сервера или неверный путь к файлу могут привести к тому, что изменение так и не вступит в силу.
У вопроса разрешить или заблокировать нет единственного правильного ответа, сайт электронной коммерции и сайт с контентом по подписке вполне обоснованно могут прийти здесь к разным решениям. Важно решать, чётко понимая, что делает каждый бот, а не сваливать их всех в одну категорию. Короткого разговора с rabbitclip достаточно, чтобы пересмотреть текущие правила robots.txt сайта.
Частые вопросы
Если я заблокирую GPTBot, исчезну ли я полностью из ChatGPT?
GPTBot собирает обучающие данные; OAI-SearchBot, питающий функцию поиска ChatGPT, управляется отдельно, так что вы можете продолжать появляться на стороне поиска, пока не заблокируете и его.
Имеет ли смысл блокировать всех ИИ-ботов одним правилом?
Обычно нет; это останавливает нежелательных обучающих ботов вместе с поисковыми и ассистентскими ботами, которые вы, возможно, действительно хотите оставить.
Вступает ли изменение robots.txt в силу мгновенно?
Боты перечитывают файл согласно собственной частоте сканирования; этот срок не фиксирован, поэтому изменение проявляется постепенно, а не мгновенно.
Как решить, каких ботов блокировать?
Это вопрос баланса между нежеланием делиться обучающими данными и нежеланием терять видимость в поиске и у ассистентов; правильный ответ различается от сайта к сайту. В большинстве случаев разумным компромиссом становится разрешить поисковых и пользовательских ботов, оставив решение по обучающим ботам открытым для пересмотра.
