Вебсправочник
Основы веб-разработки

Robots.txt и noindex: обход и индексация решают разные задачи

Запрет обхода и запрет включения страницы в поисковую выдачу — разные указания. Их смешение может оставить известный поисковику адрес в индексе или помешать увидеть нужную директиву.

Назначение

Запрет обхода и запрет включения страницы в поисковую выдачу — разные указания. Их смешение может оставить известный поисковику адрес в индексе или помешать увидеть нужную директиву.

Как это работает

Robots.txt описывает правила обхода для роботов. Noindex передаётся в метатеге robots или заголовке X-Robots-Tag. Чтобы обработать директиву на странице, робот должен получить соответствующий ответ, а не останавливаться на запрете обхода.

Пример

<!-- Только для страницы, которую не нужно индексировать: -->
<meta name="robots" content="noindex">

<!-- Альтернатива на уровне HTTP-ответа, не HTML-тег: -->
<!-- X-Robots-Tag: noindex -->

Что должно получиться

Пример показывает два места передачи ограничения, а не команду настройки всего сайта. Для PDF и других не-HTML ресурсов применяют HTTP-заголовок. Обработка указаний поисковой системой происходит не мгновенно.

Граница применения и частая ошибка

Не используйте robots.txt для хранения секретов: файл публичный, а ограничение не является авторизацией. Закрытый стенд защищают доступом. Noindex нельзя проверять только по шаблону — кеш или сервер могут отдавать другой ответ.

Самостоятельная проверка

Выберите собственную учебную страницу, не влияющую на рабочий сайт. Сверьте robots.txt, исходный HTML и заголовки конечного ответа после перенаправлений. Запишите отдельно: доступна ли она роботу и разрешена ли индексация.

Самостоятельный учебный материал. Техническая документация: первоисточник по теме ↗. Если результат отличается, проверьте код и версию браузера.