В корзине пусто!
Почему Google игнорирует robots.txt — и как это чинить

«Более специфичные правила побеждают: если есть секция user-agent: Googlebot, бот будет использовать только её» — так Джон Мюллер из Google объяснил, почему ваш robots.txt может работать не так, как вы задумали. Проблема не в баге, а в том, как устроено чтение файла.
Суть простая. Если в robots.txt есть общий блок user-agent: * и отдельный user-agent: Googlebot, Googlebot читает только свою секцию и полностью игнорирует общую. Все запреты, прописанные в *, для него как будто не существуют.
На реальном кейсе это выстрелило так: у клиента на Shopify в индекс полез спам из внутреннего поиска, хотя /search был закрыт в общем блоке. Googlebot его не видел — в его секции этого правила не было. Полный разбор — на Search Engine Journal.
Что сделать, чтобы не наступить на те же грабли:
- откройте свой robots.txt и найдите отдельную секцию
user-agent: Googlebot— если она есть, проверьте её отдельно; - продублируйте все нужные
Disallowиз общего блока в секцию Googlebot либо объедините ботов под общими правилами; - помните: robots.txt управляет сканированием, а не индексацией — чтобы страница гарантированно не попала в выдачу, ставьте
<meta name="robots" content="noindex">; - после правок проверьте файл в инструменте тестирования robots.txt и отследите, уходит ли мусор из индекса.


