Robots.txt и noindex: обход и индексация решают разные задачи
Запрет обхода и запрет включения страницы в поисковую выдачу — разные указания. Их смешение может оставить известный поисковику адрес в индексе или помешать увидеть нужную директиву.
Назначение
Запрет обхода и запрет включения страницы в поисковую выдачу — разные указания. Их смешение может оставить известный поисковику адрес в индексе или помешать увидеть нужную директиву.
Как это работает
Robots.txt описывает правила обхода для роботов. Noindex передаётся в метатеге robots или заголовке X-Robots-Tag. Чтобы обработать директиву на странице, робот должен получить соответствующий ответ, а не останавливаться на запрете обхода.
Пример
<!-- Только для страницы, которую не нужно индексировать: -->
<meta name="robots" content="noindex">
<!-- Альтернатива на уровне HTTP-ответа, не HTML-тег: -->
<!-- X-Robots-Tag: noindex -->
Что должно получиться
Пример показывает два места передачи ограничения, а не команду настройки всего сайта. Для PDF и других не-HTML ресурсов применяют HTTP-заголовок. Обработка указаний поисковой системой происходит не мгновенно.
Граница применения и частая ошибка
Не используйте robots.txt для хранения секретов: файл публичный, а ограничение не является авторизацией. Закрытый стенд защищают доступом. Noindex нельзя проверять только по шаблону — кеш или сервер могут отдавать другой ответ.
Самостоятельная проверка
Выберите собственную учебную страницу, не влияющую на рабочий сайт. Сверьте robots.txt, исходный HTML и заголовки конечного ответа после перенаправлений. Запишите отдельно: доступна ли она роботу и разрешена ли индексация.