Не каждый сайт нужно сразу показывать Яндексу и Google. Пока проект находится в разработке, на тестовом домене могут лежать незаконченные страницы, черновики, дубли и технические разделы. Иногда требуется скрыть от поиска не весь сайт, а только личный кабинет, результаты внутреннего поиска, служебные страницы или отдельные документы.
Закрыть сайт от индексации можно несколькими способами. Чаще всего для этого используют директивы robots.txt, метатег robots с параметром noindex, HTTP-заголовок X-Robots-Tag или ограничение доступа паролем. Но эти способы решают разные задачи, поэтому просто добавить Disallow в robots.txt недостаточно.
Особенно важно понимать разницу между запретом обхода и запретом появления страницы в поисковой выдаче. Именно из-за смешения этих двух понятий владельцы сайтов часто получают противоположный результат: страница вроде бы закрыта для робота, но ее адрес все равно обнаруживается в поиске.
Чем robots.txt отличается от noindex
Файл robots.txt находится в корне сайта и содержит инструкции для поисковых роботов. С его помощью можно указать, какие разделы робот может обходить, а какие ему посещать не следует.
Например, в нем можно запретить обход определенного каталога:
User-agent: *
Disallow: /private/
Такая запись говорит поддерживающим эту директиву роботам не обходить адреса внутри каталога private.
Но здесь появляется важный нюанс. Запрет обхода не равен гарантированному запрету появления URL в поиске.
Поисковая система может узнать адрес страницы не только во время обхода самого сайта. Ссылка на нее способна находиться на другой странице, в старой версии сайта или на стороннем ресурсе. В результате поисковик знает о существовании URL, хотя содержимое страницы ему недоступно.
Поэтому robots.txt хорошо подходит прежде всего для управления обходом сайта. Например, с его помощью можно ограничивать посещение роботом технических разделов, результатов внутреннего поиска или большого количества ненужных URL.
Если же задача звучит именно как эта страница не должна находиться в поисковой выдаче, обычно применяется noindex.
Для обычной HTML-страницы соответствующая инструкция размещается в секции head:
<meta name=»robots» content=»noindex»>
Когда поисковый робот загружает страницу и видит эту инструкцию, он понимает, что документ не следует включать в результаты поиска.
Здесь есть одна неочевидная ошибка. Нельзя сначала закрыть страницу для робота через robots.txt, а затем рассчитывать, что он прочитает находящийся внутри страницы noindex.
Если робот не может загрузить документ из-за запрета обхода, он может просто не увидеть метатег.
Поэтому сочетание Disallow и noindex не всегда усиливает защиту. В определенной ситуации оно, наоборот, мешает поисковой системе получить указание об исключении страницы.
Для файлов, в HTML которых невозможно разместить обычный метатег, существует HTTP-заголовок X-Robots-Tag.
Например, сервер может отправить:
X-Robots-Tag: noindex
Такой способ удобен для PDF и других ресурсов, для которых нет обычной HTML-секции head.
Получается, что выбор инструмента зависит от задачи:
- robots.txt в первую очередь управляет обходом;
- noindex запрещает включение доступной роботу страницы в поисковый индекс;
- X-Robots-Tag позволяет передать аналогичную инструкцию через HTTP-заголовок;
- авторизация ограничивает сам доступ к содержимому.
Последний вариант особенно важен, если информация действительно не предназначена для посторонних.
Как правильно закрыть тестовый сайт
Одна из самых распространенных ситуаций возникает еще до запуска проекта.
Разработчик устанавливает сайт на хостинг, подключает домен и несколько недель занимается дизайном, текстами и настройками. Сайт уже технически доступен из интернета, но показывать его пользователям и поисковым системам пока рано.
Просто надеяться, что поисковый робот его не найдет, не стоит.
Ссылку могут случайно разместить где-нибудь еще. Адрес может попасть в открытый документ. Кроме того, на сайте могут использоваться внешние сервисы и другие механизмы, благодаря которым новый URL становится известен.
Если проект действительно закрытый и находится в разработке, наиболее надежным решением будет ограничение доступа с помощью авторизации.
В таком случае человек без пароля не увидит содержимое сайта, и поисковый робот тоже не сможет его получить.
Это принципиально надежнее попытки спрятать конфиденциальный проект с помощью одного robots.txt.
Нужно помнить, что поисковая индексация и безопасность вообще относятся к разным задачам. robots.txt представляет собой доступный всем файл с рекомендациями для роботов. Он не является системой защиты информации.
Если по адресу находится внутренняя документация, персональные данные, закрытая версия интернет-магазина или другой материал, который нельзя показывать посторонним, доступ должен контролироваться на уровне сайта или сервера.
Для обычного тестового проекта возможен и другой сценарий. Сайт остается доступным разработчикам и заказчику по прямому адресу, а страницы получают noindex.
Такой вариант удобнее, когда полноценная авторизация не требуется, но нужно предотвратить появление незаконченных страниц в поиске.
В WordPress для этого существует встроенная настройка видимости для поисковых систем. Однако относиться к ней стоит внимательно.
Главная опасность возникает не во время разработки, а в день запуска.
Сайт переносится на основной домен, открывается посетителям, запускается реклама, публикуются ссылки, а запрет индексации остается включенным.
Внешне все выглядит нормально. Страницы открываются, формы работают, посетители могут пользоваться сайтом. Но поисковые роботы продолжают получать указание не добавлять его в индекс.
Поэтому снятие запрета на индексацию должно быть отдельным пунктом проверки перед запуском.
После открытия сайта стоит проверить:
- не остался ли noindex на основных страницах;
- не закрыты ли важные разделы в robots.txt;
- доступны ли страницы без пароля;
- возвращает ли сервер нормальный код ответа;
- открываются ли CSS, JavaScript и другие необходимые ресурсы;
- содержит ли Sitemap актуальные публичные страницы.
После этого сайт можно проверить средствами Яндекс.Вебмастера и Google Search Console.
Такой контроль особенно полезен после переноса тестовой версии на основной домен. Настройки разработки иногда переезжают вместе с файлами и базой данных, хотя на рабочем сайте они уже не нужны.
Какие страницы стоит скрывать от поиска
Закрывать весь работающий сайт обычно не требуется. Гораздо чаще поисковым системам не нужны отдельные технические страницы.
Типичный пример это внутренний поиск по сайту.
Пользователь вводит запрос и получает динамически сформированную страницу результатов. При большом количестве запросов таких URL может появиться огромное количество, хотя самостоятельной ценности для поисковой выдачи они не имеют.
Похожая ситуация возникает с различными фильтрами, служебными параметрами и техническими страницами.
Интернет-магазину обычно нет смысла продвигать страницу оформления заказа. Не нужна поисковику и страница личного кабинета, предназначенная для авторизованного пользователя.
На сайте также могут существовать:
- черновые страницы;
- тестовые разделы;
- внутренние результаты поиска;
- служебные URL;
- дубли страниц;
- страницы профиля пользователя;
- этапы оформления заказа;
- временные страницы разработчиков.
Но наличие страницы в этом списке еще не означает, что для нее автоматически нужно прописывать noindex.
Сначала следует понять, почему она вообще существует и какую функцию выполняет.
Например, если появились сотни дублей из-за неправильной структуры URL, запрет индексации лечит следствие, а не причину. Возможно, правильнее настроить канонические адреса, изменить генерацию ссылок или устранить ненужные страницы.
То же относится к удаленному содержимому.
Если страницы больше не существует и возвращать ее вы не собираетесь, бессмысленно сохранять пустой документ с noindex только ради того, чтобы скрыть его от поиска. Сервер должен корректно сообщать о состоянии URL.
Отдельно нужно относиться к страницам, которые уже приносят посетителей.
Перед массовым добавлением noindex желательно посмотреть поисковый трафик. Случайно закрыть от индексации сотни полезных карточек товаров или статей гораздо проще, чем кажется.
Особенно осторожно следует работать с шаблонами CMS.
Если noindex добавляется не в одну страницу вручную, а в общий шаблон, настройка способна распространиться сразу на большой раздел или даже на весь сайт.
По этой причине после любых массовых изменений полезно выборочно проверить несколько URL разных типов: главную страницу, статью, категорию, карточку товара и другие важные шаблоны.
Как проверить что сайт действительно закрыт от индексации
Посмотреть исходный код страницы полезно, но одной такой проверки недостаточно.
Важно понять, что получает именно поисковый робот.
Начать можно с самого сайта. Откройте исходный HTML и найдите метатег robots. Если используется X-Robots-Tag, потребуется проверить HTTP-заголовки ответа сервера.
Затем посмотрите robots.txt. Обычно он доступен по адресу домена с добавлением /robots.txt.
Проверьте, нет ли конфликтующей логики. Например, страница содержит noindex, но одновременно полностью закрыта от обхода тем роботом, который должен увидеть эту инструкцию.
Для Яндекса удобнее продолжить проверку в Яндекс.Вебмастере. Там можно анализировать robots.txt и состояние конкретной страницы, чтобы понять, известна ли она поисковой системе и какие ограничения применяются.
У Google аналогичную задачу помогает решать проверка URL в Search Console.
Если страница уже находится в поиске, добавление noindex не означает, что она исчезнет в ту же секунду.
Поисковая система должна снова обратиться к URL и обнаружить новую инструкцию. До повторного обхода старая информация еще некоторое время может сохраняться.
Поэтому после изменения настроек следует проверять не только код сайта, но и состояние URL в инструментах поисковых систем.
Есть и простой поисковый способ первичной диагностики. Можно выполнить запрос с оператором site: и доменным именем, чтобы посмотреть, какие страницы поисковая система показывает для сайта.
Но такой запрос лучше использовать как дополнительный ориентир, а не как точный технический аудит индекса.
Если требуется закрыть уже проиндексированную страницу, сначала нужно правильно настроить постоянный способ исключения, а затем при необходимости воспользоваться инструментами поисковой системы для ускорения удаления URL из результатов.
Особенно внимательно действуйте, если на странице случайно оказалась конфиденциальная информация.
Одного удаления результата из поисковой выдачи недостаточно. Если документ продолжает свободно открываться по прямому адресу, он по-прежнему остается публичным.
В такой ситуации сначала ограничивают доступ к самой информации, а уже затем решают вопрос с поисковым индексом.
После запуска сайта задача становится обратной.
Нужно убедиться, что страницы, которые должны привлекать посетителей, снова доступны роботам. Проверьте главную, основные категории, коммерческие страницы и статьи. Уберите случайно оставшиеся ограничения и отправьте важные URL на повторную проверку.
Правильно закрыть сайт от индексации означает не просто написать несколько строк в robots.txt. Нужно определить, хотите ли вы запретить обход, исключить страницу из поисковой выдачи или полностью закрыть ее содержимое от посторонних.
Для управления обходом используется robots.txt. Для запрета индексации доступной страницы подходит noindex, в том числе через X-Robots-Tag. А если содержимое действительно должно оставаться закрытым, надежнее ограничить доступ авторизацией.
И самое важное правило для тестовых сайтов простое: перед публичным запуском обязательно проверьте, сняты ли ограничения. Случайно оставленный noindex способен сделать полностью работающий сайт практически невидимым для поисковых систем.








