У кошику порожньо!
Чому Google ігнорує robots.txt — і як це виправити

«Більш специфічні правила перемагають: якщо є секція user-agent: Googlebot, бот використовуватиме лише її» — так Джон Мюллер із Google пояснив, чому ваш robots.txt може працювати не так, як ви задумали. Проблема не в базі, а в тому, як влаштоване читання файлу.
Суть проста. Якщо в robots.txt є загальний блок user-agent: * і окремий user-agent: Googlebot, Googlebot читає лише свою секцію й повністю ігнорує загальну. Усі заборони, прописані в *, для нього ніби не існують.
На реальному кейсі це вистрілило так: у клієнта на Shopify в індекс поліз спам із внутрішнього пошуку, хоча /search був закритий у загальному блоці. Googlebot його не бачив — у його секції цього правила не було. Повний розбір — на Search Engine Journal.
Що зробити, щоб не наступити на ті самі граблі:
- відкрийте свій robots.txt і знайдіть окрему секцію
user-agent: Googlebot— якщо вона є, перевірте її окремо; - продублюйте всі потрібні
Disallowіз загального блоку в секцію Googlebot або об'єднайте ботів під спільними правилами; - пам'ятайте: robots.txt керує скануванням, а не індексацією — щоб сторінка гарантовано не потрапила у видачу, ставте
<meta name="robots" content="noindex">; - після правок перевірте файл у інструменті тестування robots.txt і простежте, чи йде сміття з індексу.


